카탈로그
한국어 AI 데이터셋 이름순 목록
286개 중 201–240 · 6 / 8쪽
홈에 카탈로그 전체를 넣지 않기 위해, 같은 목록을 짧은 HTML 페이지로 나눈 보기입니다. 라이선스와 용량은 저장된 표기입니다. 음성·OCR·지시문·감성은 모음 페이지에 있습니다. 기어델은 파일을 보관하지 않습니다.
| 이름 | 용도 | 제공처 | 크기 | 라이선스 | 상업이용 |
|---|---|---|---|---|---|
| KBL 한국어 법률 이해 벤치마크 | 한국어 QA 데이터셋 | Hugging Face | 8.1MB | CC BY-NC 4.0 | 조건부 가능 |
| KBMC 한국어 바이오메디컬 NER | 한국어 개체명 데이터셋 | Hugging Face | 1.4MB | Apache 2.0 | 가능 |
| KBS/MBC 시사 토론 및 교양 방송 요약 | 한국어 요약 데이터셋 | AI Hub | 440MB | AI Hub 이용안내 | 조건부 가능 |
| KcBERT 사전학습 댓글 코퍼스 | 한국어 사전학습 코퍼스 | Hugging Face | 7.90 GiB | CC BY-SA 4.0 | 가능 |
| KIT-19 — 한국어 인스트럭션 19개 태스크 | 한국어 지시문 학습 데이터셋 | Hugging Face | 85MB | CC BY 4.0 | 가능 |
| KLUE 연합뉴스 기사 제목 분류 데이터셋 | 한국어 NLP 데이터셋 | Hugging Face (KLUE) | 소용량 | CC BY-SA 4.0 | 가능 |
| KLUE 한국어 개체명 인식 데이터셋 | 한국어 개체명 데이터셋 | Hugging Face (KLUE) | 중용량 | CC BY-SA 4.0 | 가능 |
| KLUE 한국어 관계 추출 데이터셋 | 한국어 NLP 데이터셋 | Hugging Face (KLUE) | 소용량 | CC BY-SA 4.0 | 가능 |
| KLUE 한국어 기계독해 벤치마크 | 한국어 QA 데이터셋 | Hugging Face (KLUE) | 중용량 | CC BY-SA 4.0 | 가능 |
| KLUE 한국어 유사도 측정 데이터셋 | 한국어 LLM 벤치마크 | Hugging Face (KLUE) | 소용량 | CC BY-SA 4.0 | 가능 |
| KLUE 한국어 자연어 추론 데이터셋 | 한국어 NLP 데이터셋 | Hugging Face (KLUE) | 소용량 | CC BY-SA 4.0 | 가능 |
| KLUE Benchmark | 한국어 LLM 벤치마크 | Hugging Face | 62.3 MB | CC BY-SA 4.0 | 조건부 가능 |
| KMMLU | 한국어 LLM 벤치마크 | Hugging Face | 70.7 MB | CC BY-ND 4.0 | 불가 |
| KMMLU-Pro 전문 지식 평가 데이터셋 | 한국어 LLM 벤치마크 | Hugging Face (LGAI-EXAONE) | 12MB | CC BY-NC 4.0 | 가능 |
| KMRE 한국어 임상의학 논문 관계 추출 데이터셋 | 한국어 NLP 데이터셋 | GitHub | 15MB | Apache 2.0 | 가능 |
| Ko-Agent-Trajectories-1.0 | 한국어 NLP 데이터셋 | Hugging Face | 대용량 | Apache 2.0 | 가능 |
| Ko-ARC Challenge | 한국어 LLM 벤치마크 | Hugging Face | 8MB | CC BY-SA 4.0 | 가능 |
| Ko-Llama 다각적 지시어 미세조정 데이터셋 | 한국어 지시문 학습 데이터셋 | Hugging Face | 대용량 | Apache 2.0 | 가능 |
| Ko-MMLU-Pro | 한국어 LLM 벤치마크 | Hugging Face | 45MB | MIT | 가능 |
| Ko-PIQA 한국어 물리 상식 | 한국어 QA 데이터셋 | Hugging Face | 204KB | 원본 확인 | 조건부 가능 |
| KoAlpaca v1.0 (번역 Alpaca) | 한국어 지시문 학습 데이터셋 | Hugging Face | 8.1MB | CC BY-NC 4.0 | 조건부 가능 |
| KoAlpaca-v1.1a | 한국어 지시문 학습 데이터셋 | Hugging Face | 대용량 | 원본 확인 | 가능 |
| KoBALT-700 한국어 언어학 벤치마크 | 한국어 LLM 벤치마크 | Hugging Face | 644KB | CC BY-NC 4.0 | 조건부 가능 |
| KoBBQ 한국어 사회 편향 QA | 한국어 QA 데이터셋 | Hugging Face | 2.4MB | MIT | 가능 |
| KoBEST 단단문 참거짓 판정 (BoolQ) | 한국어 QA 데이터셋 | Hugging Face (SKT-brain) | 소용량 | CC BY-SA 4.0 | 가능 |
| KoBEST 문맥상 어휘 다의어 추론 (WiC) | 한국어 NLP 데이터셋 | Hugging Face (SKT-brain) | 소용량 | CC BY-SA 4.0 | 가능 |
| KoBEST 상황 지속성 추론 (HellaSwag) | 한국어 LLM 벤치마크 | Hugging Face (SKT-brain) | 소용량 | CC BY-SA 4.0 | 가능 |
| KoBEST 언어 추론 벤치마크 | 한국어 LLM 벤치마크 | Hugging Face | 5.1MB | CC BY-SA 4.0 | 가능 |
| KoBEST 언어추론 벤치마크 (COPA) | 한국어 LLM 벤치마크 | Hugging Face (SKT-brain) | 소용량 | CC BY-SA 4.0 | 가능 |
| KoBigBench Lite | 한국어 LLM 벤치마크 | Hugging Face | 12MB | 원본 확인 | 가능 |
| KoCommonGEN v2 | 한국어 LLM 벤치마크 | Hugging Face | 183KB | 원본 확인 | 조건부 가능 |
| KoCoSa 한국어 세부적 상식 추론 지시 데이터셋 | 한국어 지시문 학습 데이터셋 | GitHub | 18MB | Apache 2.0 | 가능 |
| KoDialogBench 대화 이해 벤치마크 | 한국어 LLM 벤치마크 | Hugging Face | 82,962 예제, 21개 테스트셋 | CC BY-NC-SA 4.0 | 조건부 가능 |
| KoELECTRA 보캡 최적화 원시 텍스트 말뭉치 | 한국어 대화 데이터셋 | GitHub (monologg) | 대용량 (34GB) | Apache 2.0 | 가능 |
| KoelLabs 다국어 화자 한국어 악센트 음성 데이터셋 | 한국어 음성인식 데이터셋 | Hugging Face (KoelLabs) | 18 GB | CC BY-NC 4.0 | 가능 |
| KoGEM — 한국어 문법 평가 벤치마크 | 한국어 문법 평가 벤치마크 | Hugging Face | 1.2MB | MIT | 가능 |
| KoGPT2 기본 사전학습 코퍼스 | 한국어 사전학습 코퍼스 | Hugging Face | 3.2GB | 원본 확인 | 가능 |
| KoIn 한국 인플루언서 인물 인식 이미지 데이터셋 | 한국어 비전 데이터셋 | GitHub (dukong1) | 140 GB | MIT | 가능 |
| KoInFoBench 한국어 지시어 이행 평가 데이터셋 | 한국어 지시문 학습 데이터셋 | Hugging Face | 소용량 | MIT | 가능 |
| KOLD 한국어 공격 발화 | 한국어 유해성 데이터셋 | GitHub | 40,429 댓글 | 원본 확인 | 조건부 가능 |