모음
한국어 LLM 벤치마크 데이터셋
47 개 · GearDel
기어델 카탈로그에서 이 주제는 47개입니다 (텍스트 46개, 이미지 1개). 제공처: Hugging Face 27개, GitHub 3개. 예: KLUE Benchmark, KMMLU, CLIcK (Cultural & Legal Knowledge). 상업 이용 가능 표기는 35개입니다. 여기는 평가용입니다. 사전학습 코퍼스와 같은 페이지로 보지 마세요. 기어델은 파일을 호스팅하지 않으니 원본 링크에서 받으세요.
테스트 스플릿으로 학습하지 마세요. KLUE·KoBEST·KMMLU 계열은 평가용이고, 학습은 지시문·코퍼스 모음으로 가세요.
| 이름 | 용도 | 제공처 | 크기 | 라이선스 | 상업이용 |
|---|---|---|---|---|---|
| KLUE Benchmark | 한국어 LLM 벤치마크 | Hugging Face | 62.3 MB | CC BY-SA 4.0 | 조건부 가능 |
| KMMLU | 한국어 LLM 벤치마크 | Hugging Face | 70.7 MB | CC BY-ND 4.0 | 불가 |
| CLIcK (Cultural & Legal Knowledge) | 한국어 LLM 벤치마크 | GitHub | 5.5MB | 원본 확인 | 가능 |
| KoBEST 언어 추론 벤치마크 | 한국어 LLM 벤치마크 | Hugging Face | 5.1MB | CC BY-SA 4.0 | 가능 |
| KoBigBench Lite | 한국어 LLM 벤치마크 | Hugging Face | 12MB | 원본 확인 | 가능 |
| KoInFoBench 한국어 지시어 이행 평가 데이터셋 | 한국어 지시문 학습 데이터셋 | Hugging Face | 소용량 | MIT | 가능 |
| 한국어 다단계 논리 추론 데이터셋 | 한국어 QA 데이터셋 | Hugging Face | 소용량 | Apache 2.0 | 가능 |
| 한국 문화 맥락 이해 벤치마크 데이터셋 | 한국어 LLM 벤치마크 | Hugging Face (SOGANG-ISDS) | 소용량 | Apache 2.0 | 가능 |
| SNU Ko-MuSR 한국어 다단계 추론 데이터셋 | 한국어 LLM 벤치마크 | Hugging Face (thunder-research-group) | 소용량 | MIT | 가능 |
| KLUE 연합뉴스 기사 제목 분류 데이터셋 | 한국어 NLP 데이터셋 | Hugging Face (KLUE) | 소용량 | CC BY-SA 4.0 | 가능 |
| KLUE 한국어 자연어 추론 데이터셋 | 한국어 NLP 데이터셋 | Hugging Face (KLUE) | 소용량 | CC BY-SA 4.0 | 가능 |
| KLUE 한국어 유사도 측정 데이터셋 | 한국어 LLM 벤치마크 | Hugging Face (KLUE) | 소용량 | CC BY-SA 4.0 | 가능 |
| KLUE 한국어 개체명 인식 데이터셋 | 한국어 개체명 데이터셋 | Hugging Face (KLUE) | 중용량 | CC BY-SA 4.0 | 가능 |
| KLUE 한국어 관계 추출 데이터셋 | 한국어 NLP 데이터셋 | Hugging Face (KLUE) | 소용량 | CC BY-SA 4.0 | 가능 |
| KLUE 한국어 기계독해 벤치마크 | 한국어 QA 데이터셋 | Hugging Face (KLUE) | 중용량 | CC BY-SA 4.0 | 가능 |
| KoBEST 언어추론 벤치마크 (COPA) | 한국어 LLM 벤치마크 | Hugging Face (SKT-brain) | 소용량 | CC BY-SA 4.0 | 가능 |
| KoBEST 상황 지속성 추론 (HellaSwag) | 한국어 LLM 벤치마크 | Hugging Face (SKT-brain) | 소용량 | CC BY-SA 4.0 | 가능 |
| KoBEST 단단문 참거짓 판정 (BoolQ) | 한국어 QA 데이터셋 | Hugging Face (SKT-brain) | 소용량 | CC BY-SA 4.0 | 가능 |
| KoBEST 문맥상 어휘 다의어 추론 (WiC) | 한국어 NLP 데이터셋 | Hugging Face (SKT-brain) | 소용량 | CC BY-SA 4.0 | 가능 |
| 한국어 속담 빈칸 완성 데이터셋 | 한국어 LLM 벤치마크 | GitHub | 소용량 | MIT | 가능 |
| KMMLU-Pro 전문 지식 평가 데이터셋 | 한국어 LLM 벤치마크 | Hugging Face (LGAI-EXAONE) | 12MB | CC BY-NC 4.0 | 가능 |
| 서울대 Thunder-KoNUBench 한국어 부정문 이해 데이터셋 | 한국어 LLM 벤치마크 | Hugging Face (thunder-research-group) | 5.4MB | CC BY-NC-SA 4.0 | 가능 |
| K-BrowseComp 한국어 웹 브라우징 에이전트 벤치마크 | 한국어 LLM 벤치마크 | Hugging Face (prometheus-eval) | 3.5MB | MIT | 가능 |
| CSAT-KOREAN-2025 대학수학능력시험 국어 데이터셋 | 한국어 QA 데이터셋 | Hugging Face (KKACHI-HUB) | 3.2MB | MIT | 가능 |
| 한국인 생활 상식 및 논리적 연쇄 추론 데이터 | 한국어 LLM 벤치마크 | Hugging Face / GitHub | 중용량 | Apache 2.0 | 가능 |
| 한국어 상식 추론 객관식 평가 벤치마크 | 한국어 LLM 벤치마크 | Hugging Face | 소용량 | Apache 2.0 | 가능 |
| KoGEM — 한국어 문법 평가 벤치마크 | 한국어 문법 평가 벤치마크 | Hugging Face | 1.2MB | MIT | 가능 |
| Ko-MMLU-Pro | 한국어 LLM 벤치마크 | Hugging Face | 45MB | MIT | 가능 |
| 한국어 안전성 벤치마크 (KoSafetyBench) | 한국어 LLM 벤치마크 | Hugging Face | 15MB | CC BY 4.0 | 가능 |
| Ko-ARC Challenge | 한국어 LLM 벤치마크 | Hugging Face | 8MB | CC BY-SA 4.0 | 가능 |
| HAE-RAE Bench 1.1 | 한국어 LLM 벤치마크 | Hugging Face | 2.9MB | CC BY-NC-ND 4.0 | 조건부 가능 |
| HAE-RAE Bench 2.0 | 한국어 LLM 벤치마크 | Hugging Face | 1.0MB | MIT | 가능 |
| KoCommonGEN v2 | 한국어 LLM 벤치마크 | Hugging Face | 183KB | 원본 확인 | 조건부 가능 |
| APEACH 한국어 혐오 표현 평가셋 | 한국어 LLM 벤치마크 | Hugging Face | 1.1MB | CC BY-SA 4.0 | 가능 |
| HRM8K (HAE-RAE Math 8K) | 한국어 LLM 벤치마크 | Hugging Face | 4.9MB | MIT | 가능 |
| KorNAT 한국 상식·사회가치 QA | 한국어 QA 데이터셋 | Hugging Face | 2.6MB | CC BY-NC 4.0 | 조건부 가능 |
| HRMCR 다단계 한국 상식 추론 | 한국어 LLM 벤치마크 | Hugging Face | 106KB | Apache 2.0 | 가능 |
| KoBBQ 한국어 사회 편향 QA | 한국어 QA 데이터셋 | Hugging Face | 2.4MB | MIT | 가능 |
| KorMedMCQA 보건의료 국가시험 QA | 한국어 QA 데이터셋 | Hugging Face | 2.1MB | CC BY-NC 4.0 | 조건부 가능 |
| KoBALT-700 한국어 언어학 벤치마크 | 한국어 LLM 벤치마크 | Hugging Face | 644KB | CC BY-NC 4.0 | 조건부 가능 |
| KoSimpleQA 한국어 사실성 QA | 한국어 QA 데이터셋 | Hugging Face | 301KB | 원본 확인 | 조건부 가능 |
| Ko-PIQA 한국어 물리 상식 | 한국어 QA 데이터셋 | Hugging Face | 204KB | 원본 확인 | 조건부 가능 |
| K-MMBench 한국어 비전-언어 벤치마크 | 한국어 비전 데이터셋 | Hugging Face | 92.4MB | CC BY-NC 4.0 | 조건부 가능 |
| K²-Eval 한국 문화 지시 평가 | 한국어 지시문 학습 데이터셋 | Hugging Face | 178KB | MIT | 가능 |
| KoDialogBench 대화 이해 벤치마크 | 한국어 LLM 벤치마크 | Hugging Face | 82,962 예제, 21개 테스트셋 | CC BY-NC-SA 4.0 | 조건부 가능 |
| FunctionChat-Bench 한국어 도구 호출 | 한국어 LLM 벤치마크 | GitHub | 500 단일턴 + 45 멀티턴 | Apache 2.0 | 가능 |
| KBL 한국어 법률 이해 벤치마크 | 한국어 QA 데이터셋 | Hugging Face | 8.1MB | CC BY-NC 4.0 | 조건부 가능 |