카탈로그
한국어 AI 데이터셋 이름순 목록
286개 중 281–286 · 8 / 8쪽
홈에 카탈로그 전체를 넣지 않기 위해, 같은 목록을 짧은 HTML 페이지로 나눈 보기입니다. 라이선스와 용량은 저장된 표기입니다. 음성·OCR·지시문·감성은 모음 페이지에 있습니다. 기어델은 파일을 보관하지 않습니다.
| 이름 | 용도 | 제공처 | 크기 | 라이선스 | 상업이용 |
|---|---|---|---|---|---|
| TinyStories 한국어 번역 데이터셋 | 한국어 번역 데이터셋 | Hugging Face | 대용량 | MIT | 가능 |
| ToM-Diary 한국어 마음이해(Theory of Mind) 데이터셋 | 한국어 NLP 데이터셋 | GitHub | 8.5MB | Apache 2.0 | 가능 |
| TyDi-QA (ko) (구글 다국어 질의응답) | 한국어 QA 데이터셋 | GitHub | 18.5MB | Apache 2.0 | 가능 |
| WanJuanSiLu 한국어 고품질 웹 텍스트 코퍼스 | 한국어 대화 데이터셋 | Hugging Face (opendatalab) | 124 GB | CC BY 4.0 | 가능 |
| xP3x 한국어 프롬프트 서브셋 | 한국어 지시문 학습 데이터셋 | Hugging Face | 한글 4,642,468행 | Apache 2.0 | 조건부 가능 |
| Zeroth 한국어 음성 인식 오픈소스 데이터셋 | 한국어 음성인식 데이터셋 | GitHub | 대용량 | Apache 2.0 | 가능 |