카탈로그
한국어 AI 데이터셋 이름순 목록
286개 중 241–280 · 7 / 8쪽
홈에 카탈로그 전체를 넣지 않기 위해, 같은 목록을 짧은 HTML 페이지로 나눈 보기입니다. 라이선스와 용량은 저장된 표기입니다. 음성·OCR·지시문·감성은 모음 페이지에 있습니다. 기어델은 파일을 보관하지 않습니다.
| 이름 | 용도 | 제공처 | 크기 | 라이선스 | 상업이용 |
|---|---|---|---|---|---|
| KOpen 고품질 에르메스 한국어 데이터셋 | 한국어 번역 데이터셋 | Hugging Face | 중용량 | MIT | 가능 |
| KOpen-Platypus | 한국어 지시문 학습 데이터셋 | Hugging Face | 15.9MB | CC BY 4.0 | 가능 |
| Korean Open-ORPO SFT+DPO | 한국어 지시문 학습 데이터셋 | Hugging Face | 65MB | Apache 2.0 | 가능 |
| Korean Receipts (금융 영수증 OCR) | 영수증 OCR 데이터셋 | Hugging Face | 95MB | CC BY 4.0 | 가능 |
| Korean SAT Math 수능 수학 논리 추론 데이터셋 | 한국어 NLP 데이터셋 | Hugging Face (Quadyun) | 8.5MB | MIT | 가능 |
| Korean Tourist Spot Dataset (풍경 이미지) | 한국어 비전 데이터셋 | GitHub | 8.4GB | 원본 확인 | 가능 |
| Korean-Light-OCR (야외 간판 및 표지판) | 한국어 OCR 데이터셋 | GitHub | 4.2GB | 원본 확인 | 가능 |
| KorMedMCQA 보건의료 국가시험 QA | 한국어 QA 데이터셋 | Hugging Face | 2.1MB | CC BY-NC 4.0 | 조건부 가능 |
| KorNAT 한국 상식·사회가치 QA | 한국어 QA 데이터셋 | Hugging Face | 2.6MB | CC BY-NC 4.0 | 조건부 가능 |
| KorWikiTableQuestions | 한국어 QA 데이터셋 | GitHub | 70K 표 QA | CC BY-SA 4.0 | 가능 |
| KoSBi 한국어 편향성 완화 데이터셋 | 한국어 NLP 데이터셋 | GitHub | 대용량 | MIT | 가능 |
| KoSEnd 한국어 어휘론적 함의(Entailment) 데이터셋 | 한국어 NLP 데이터셋 | GitHub | 6.2MB | Apache 2.0 | 가능 |
| KoSimpleQA 한국어 사실성 QA | 한국어 QA 데이터셋 | Hugging Face | 301KB | 원본 확인 | 조건부 가능 |
| KoSum 한국어 유튜브 멀티모달 요약 데이터셋 | 한국어 음성 데이터셋 | Hugging Face (iontail) | 45GB | CC BY-NC 4.0 | 가능 |
| KOTE 한국어 온라인 댓글 감정 데이터셋 | 한국어 감성분석 데이터셋 | Hugging Face (searle-j) | 중용량 | MIT | 가능 |
| KPoEM 한국어 고전 시 문학 정서 주석 데이터셋 | 한국어 감성분석 데이터셋 | GitHub | 4.2MB | MIT | 가능 |
| KRETA (Korean Rich Text Visual QA) | 한국어 OCR 데이터셋 | Hugging Face | 125MB | 원본 확인 | 가능 |
| KREW 한국어 페르소나 역할극(Role-Playing) 데이터셋 | 한국어 지시문 학습 데이터셋 | Hugging Face (huggingface-KREW) | 28MB | Apache 2.0 | 가능 |
| KsponSpeech (대규모 자유발화) | 한국어 자유발화 음성인식 | AI Hub | 1000시간 | AI Hub 이용안내 | 조건부 가능 |
| KSS Dataset (성우 음성 합성) | 한국어 TTS 데이터셋 | Hugging Face | 12시간+ | CC BY-NC-SA 4.0 | 불가 |
| KULLM-v2 (한국어 지시문) | 한국어 지시문 학습 데이터셋 | Hugging Face | 180MB | Apache 2.0 | 가능 |
| LIMA 한국어 고품질 극소정예 데이터셋 | 한국어 지시문 학습 데이터셋 | Hugging Face | 소용량 | CC BY-NC-SA 4.0 | 가능 |
| MeloTTS 한국어 실시간 음성합성 데이터셋 | 한국어 TTS 데이터셋 | Hugging Face | 중용량 | MIT | 가능 |
| OLKAVS 한국어 시청각 음성 | 한국어 음성인식 데이터셋 | GitHub | 1,150시간 오디오 | 원본 확인 | 조건부 가능 |
| Open Subtitles (ko-en) (자막 번역) | 한국어 번역 데이터셋 | GitHub | 대용량 | 원본 확인 | 가능 |
| OpenAssistant Guanaco 한국어 | 한국어 지시문 학습 데이터셋 | Hugging Face | 16.7MB | Apache 2.0 | 가능 |
| OpenOrca-KO | 한국어 지시문 학습 데이터셋 | Hugging Face | 21.8MB | MIT | 가능 |
| Orca 한국어 DPO 선호도 데이터셋 | 한국어 NLP 데이터셋 | Hugging Face | 중용량 | Apache 2.0 | 가능 |
| Pansori TEDxKR 음성 코퍼스 | 한국어 음성인식 데이터셋 | GitHub | 약 3시간 | CC BY-NC-ND 4.0 | 조건부 가능 |
| ParaKQC 한국어 질문·명령 병렬 | 한국어 NLP 데이터셋 | GitHub | 10,000 발화 (v1) | CC BY-SA 4.0 | 가능 |
| PAWS-X (ko) (문장 유사성 분류) | 한국어 NLP 데이터셋 | GitHub | 5.1MB | Other | 조건부 가능 |
| QARV 한국어 인스트럭션 데이터셋 | 한국어 지시문 학습 데이터셋 | Hugging Face | 중용량 | MIT | 가능 |
| skt/KVQA (시각장애 보조) | 한국어 비전 데이터셋 | Hugging Face | 100,445개 페어 | Korean VQA License | 불가 |
| SmileStyle 한국어 다채로운 문체 변환 코퍼스 | 한국어 사전학습 코퍼스 | GitHub (smilegate-ai) | 35MB | MIT | 가능 |
| SNS 소셜 대화 정제 데이터셋 | 한국어 대화 데이터셋 | AI Hub | 980MB | AI Hub 이용안내 | 조건부 가능 |
| SNU Ko-MuSR 한국어 다단계 추론 데이터셋 | 한국어 LLM 벤치마크 | Hugging Face (thunder-research-group) | 소용량 | MIT | 가능 |
| Speech Emotion Dataset (ko) | 한국어 음성 데이터셋 | GitHub | 3.2GB | 원본 확인 | 가능 |
| SQuARe 한국어 민감 주제 안전성 데이터셋 | 한국어 NLP 데이터셋 | GitHub | 중용량 | MIT | 가능 |
| Table-VQA-ko (스캔문서 표 판독) | 한국어 OCR 데이터셋 | Hugging Face | 185MB | Apache 2.0 | 가능 |
| Tatoeba (ko-en) | 한국어 번역 데이터셋 | GitHub | 3.4MB | CC BY 2.0 | 가능 |