카탈로그

한국어 AI 데이터셋 이름순 목록

286개 중 201–240 · 6 / 8쪽

홈에 카탈로그 전체를 넣지 않기 위해, 같은 목록을 짧은 HTML 페이지로 나눈 보기입니다. 라이선스와 용량은 저장된 표기입니다. 음성·OCR·지시문·감성은 모음 페이지에 있습니다. 기어델은 파일을 보관하지 않습니다.

과제별로 고르기 →·홈에서 검색 →

이름용도제공처크기라이선스상업이용
KBL 한국어 법률 이해 벤치마크한국어 QA 데이터셋Hugging Face8.1MBCC BY-NC 4.0조건부 가능
KBMC 한국어 바이오메디컬 NER한국어 개체명 데이터셋Hugging Face1.4MBApache 2.0가능
KBS/MBC 시사 토론 및 교양 방송 요약한국어 요약 데이터셋AI Hub440MBAI Hub 이용안내조건부 가능
KcBERT 사전학습 댓글 코퍼스한국어 사전학습 코퍼스Hugging Face7.90 GiBCC BY-SA 4.0가능
KIT-19 — 한국어 인스트럭션 19개 태스크한국어 지시문 학습 데이터셋Hugging Face85MBCC BY 4.0가능
KLUE 연합뉴스 기사 제목 분류 데이터셋한국어 NLP 데이터셋Hugging Face (KLUE)소용량CC BY-SA 4.0가능
KLUE 한국어 개체명 인식 데이터셋한국어 개체명 데이터셋Hugging Face (KLUE)중용량CC BY-SA 4.0가능
KLUE 한국어 관계 추출 데이터셋한국어 NLP 데이터셋Hugging Face (KLUE)소용량CC BY-SA 4.0가능
KLUE 한국어 기계독해 벤치마크한국어 QA 데이터셋Hugging Face (KLUE)중용량CC BY-SA 4.0가능
KLUE 한국어 유사도 측정 데이터셋한국어 LLM 벤치마크Hugging Face (KLUE)소용량CC BY-SA 4.0가능
KLUE 한국어 자연어 추론 데이터셋한국어 NLP 데이터셋Hugging Face (KLUE)소용량CC BY-SA 4.0가능
KLUE Benchmark한국어 LLM 벤치마크Hugging Face62.3 MBCC BY-SA 4.0조건부 가능
KMMLU한국어 LLM 벤치마크Hugging Face70.7 MBCC BY-ND 4.0불가
KMMLU-Pro 전문 지식 평가 데이터셋한국어 LLM 벤치마크Hugging Face (LGAI-EXAONE)12MBCC BY-NC 4.0가능
KMRE 한국어 임상의학 논문 관계 추출 데이터셋한국어 NLP 데이터셋GitHub15MBApache 2.0가능
Ko-Agent-Trajectories-1.0한국어 NLP 데이터셋Hugging Face대용량Apache 2.0가능
Ko-ARC Challenge한국어 LLM 벤치마크Hugging Face8MBCC BY-SA 4.0가능
Ko-Llama 다각적 지시어 미세조정 데이터셋한국어 지시문 학습 데이터셋Hugging Face대용량Apache 2.0가능
Ko-MMLU-Pro한국어 LLM 벤치마크Hugging Face45MBMIT가능
Ko-PIQA 한국어 물리 상식한국어 QA 데이터셋Hugging Face204KB원본 확인조건부 가능
KoAlpaca v1.0 (번역 Alpaca)한국어 지시문 학습 데이터셋Hugging Face8.1MBCC BY-NC 4.0조건부 가능
KoAlpaca-v1.1a한국어 지시문 학습 데이터셋Hugging Face대용량원본 확인가능
KoBALT-700 한국어 언어학 벤치마크한국어 LLM 벤치마크Hugging Face644KBCC BY-NC 4.0조건부 가능
KoBBQ 한국어 사회 편향 QA한국어 QA 데이터셋Hugging Face2.4MBMIT가능
KoBEST 단단문 참거짓 판정 (BoolQ)한국어 QA 데이터셋Hugging Face (SKT-brain)소용량CC BY-SA 4.0가능
KoBEST 문맥상 어휘 다의어 추론 (WiC)한국어 NLP 데이터셋Hugging Face (SKT-brain)소용량CC BY-SA 4.0가능
KoBEST 상황 지속성 추론 (HellaSwag)한국어 LLM 벤치마크Hugging Face (SKT-brain)소용량CC BY-SA 4.0가능
KoBEST 언어 추론 벤치마크한국어 LLM 벤치마크Hugging Face5.1MBCC BY-SA 4.0가능
KoBEST 언어추론 벤치마크 (COPA)한국어 LLM 벤치마크Hugging Face (SKT-brain)소용량CC BY-SA 4.0가능
KoBigBench Lite한국어 LLM 벤치마크Hugging Face12MB원본 확인가능
KoCommonGEN v2한국어 LLM 벤치마크Hugging Face183KB원본 확인조건부 가능
KoCoSa 한국어 세부적 상식 추론 지시 데이터셋한국어 지시문 학습 데이터셋GitHub18MBApache 2.0가능
KoDialogBench 대화 이해 벤치마크한국어 LLM 벤치마크Hugging Face82,962 예제, 21개 테스트셋CC BY-NC-SA 4.0조건부 가능
KoELECTRA 보캡 최적화 원시 텍스트 말뭉치한국어 대화 데이터셋GitHub (monologg)대용량 (34GB)Apache 2.0가능
KoelLabs 다국어 화자 한국어 악센트 음성 데이터셋한국어 음성인식 데이터셋Hugging Face (KoelLabs)18 GBCC BY-NC 4.0가능
KoGEM — 한국어 문법 평가 벤치마크한국어 문법 평가 벤치마크Hugging Face1.2MBMIT가능
KoGPT2 기본 사전학습 코퍼스한국어 사전학습 코퍼스Hugging Face3.2GB원본 확인가능
KoIn 한국 인플루언서 인물 인식 이미지 데이터셋한국어 비전 데이터셋GitHub (dukong1)140 GBMIT가능
KoInFoBench 한국어 지시어 이행 평가 데이터셋한국어 지시문 학습 데이터셋Hugging Face소용량MIT가능
KOLD 한국어 공격 발화한국어 유해성 데이터셋GitHub40,429 댓글원본 확인조건부 가능