모음
상업 이용 가능한 한국어 AI 데이터셋
161 개 · GearDel
기어델 카탈로그에서 이 주제는 161개입니다 (텍스트 145개, 음성 8개, 이미지 8개). 제공처: Hugging Face 62개, GitHub 52개. 예: KULLM-v2 (한국어 지시문), GovOn Legal Response Dataset, KoAlpaca-v1.1a. 상업 이용 가능 표기는 161개입니다. 카탈로그의 상업 이용 표기는 힌트입니다. 제품에 쓰기 전에 제공처 약관을 다시 읽으세요. 기어델은 파일을 호스팅하지 않으니 원본 링크에서 받으세요.
가능 표기 161개, 조건부·제한 0개입니다. AI Hub·국립국어원은 여기 있어도 별도 약관이 거의 항상 있습니다.
| 이름 | 용도 | 제공처 | 크기 | 라이선스 | 상업이용 |
|---|---|---|---|---|---|
| KULLM-v2 (한국어 지시문) | 한국어 지시문 학습 데이터셋 | Hugging Face | 180MB | Apache 2.0 | 가능 |
| GovOn Legal Response Dataset | 한국어 QA 데이터셋 | Hugging Face | 267 MB | CC BY 4.0 | 가능 |
| KoAlpaca-v1.1a | 한국어 지시문 학습 데이터셋 | Hugging Face | 대용량 | 원본 확인 | 가능 |
| CLIcK (Cultural & Legal Knowledge) | 한국어 LLM 벤치마크 | GitHub | 5.5MB | 원본 확인 | 가능 |
| KoBEST 언어 추론 벤치마크 | 한국어 LLM 벤치마크 | Hugging Face | 5.1MB | CC BY-SA 4.0 | 가능 |
| GSM8K 한국어 번역 수학 데이터셋 | 한국어 번역 데이터셋 | Hugging Face | 4.8MB | MIT | 가능 |
| KoBigBench Lite | 한국어 LLM 벤치마크 | Hugging Face | 12MB | 원본 확인 | 가능 |
| KoGPT2 기본 사전학습 코퍼스 | 한국어 사전학습 코퍼스 | Hugging Face | 3.2GB | 원본 확인 | 가능 |
| Speech Emotion Dataset (ko) | 한국어 음성 데이터셋 | GitHub | 3.2GB | 원본 확인 | 가능 |
| COYO-700M (카카오브레인) | 한국어 비전 데이터셋 | Hugging Face | 대용량 (7억 쌍) | CC BY 4.0 | 가능 |
| KRETA (Korean Rich Text Visual QA) | 한국어 OCR 데이터셋 | Hugging Face | 125MB | 원본 확인 | 가능 |
| Korean Tourist Spot Dataset (풍경 이미지) | 한국어 비전 데이터셋 | GitHub | 8.4GB | 원본 확인 | 가능 |
| Korean-Light-OCR (야외 간판 및 표지판) | 한국어 OCR 데이터셋 | GitHub | 4.2GB | 원본 확인 | 가능 |
| Korean Receipts (금융 영수증 OCR) | 영수증 OCR 데이터셋 | Hugging Face | 95MB | CC BY 4.0 | 가능 |
| Table-VQA-ko (스캔문서 표 판독) | 한국어 OCR 데이터셋 | Hugging Face | 185MB | Apache 2.0 | 가능 |
| TyDi-QA (ko) (구글 다국어 질의응답) | 한국어 QA 데이터셋 | GitHub | 18.5MB | Apache 2.0 | 가능 |
| Open Subtitles (ko-en) (자막 번역) | 한국어 번역 데이터셋 | GitHub | 대용량 | 원본 확인 | 가능 |
| Tatoeba (ko-en) | 한국어 번역 데이터셋 | GitHub | 3.4MB | CC BY 2.0 | 가능 |
| TinyStories 한국어 번역 데이터셋 | 한국어 번역 데이터셋 | Hugging Face | 대용량 | MIT | 가능 |
| KoInFoBench 한국어 지시어 이행 평가 데이터셋 | 한국어 지시문 학습 데이터셋 | Hugging Face | 소용량 | MIT | 가능 |
| 한국어 사전학습 위키 코퍼스 | 한국어 사전학습 코퍼스 | Hugging Face | 중용량 | MIT | 가능 |
| 오픈 한국어 인스트럭션 데이터셋 | 한국어 지시문 학습 데이터셋 | Hugging Face | 대용량 | MIT | 가능 |
| 청와대 국민청원 데이터셋 | 한국어 NLP 데이터셋 | Hugging Face | 대용량 | MIT | 가능 |
| QARV 한국어 인스트럭션 데이터셋 | 한국어 지시문 학습 데이터셋 | Hugging Face | 중용량 | MIT | 가능 |
| Orca 한국어 DPO 선호도 데이터셋 | 한국어 NLP 데이터셋 | Hugging Face | 중용량 | Apache 2.0 | 가능 |
| KOpen 고품질 에르메스 한국어 데이터셋 | 한국어 번역 데이터셋 | Hugging Face | 중용량 | MIT | 가능 |
| 한국어 상업용 지시어 데이터셋 | 한국어 지시문 학습 데이터셋 | Hugging Face | 대용량 | MIT | 가능 |
| 캐럿AI 한국어 지시어 데이터셋 | 한국어 지시문 학습 데이터셋 | Hugging Face | 소용량 | Apache 2.0 | 가능 |
| 한국어 다단계 논리 추론 데이터셋 | 한국어 QA 데이터셋 | Hugging Face | 소용량 | Apache 2.0 | 가능 |
| 한국어 금융 특화 지시어 데이터셋 | 한국어 지시문 학습 데이터셋 | Hugging Face | 중용량 | MIT | 가능 |
| 한국어 일상 구어체 대화 데이터셋 | 한국어 대화 데이터셋 | Hugging Face | 대용량 | Apache 2.0 | 가능 |
| 송영숙 한국어 챗봇 문답 데이터셋 | 한국어 감성분석 데이터셋 | GitHub | 소용량 | MIT | 가능 |
| 한국어 온라인 댓글 욕설 탐지 데이터셋 | 한국어 유해성 데이터셋 | GitHub | 소용량 | MIT | 가능 |
| 한국어 인공 교과서 코퍼스 데이터셋 | 한국어 사전학습 코퍼스 | Hugging Face | 대용량 | Apache 2.0 | 가능 |
| SQuARe 한국어 민감 주제 안전성 데이터셋 | 한국어 NLP 데이터셋 | GitHub | 중용량 | MIT | 가능 |
| KoSBi 한국어 편향성 완화 데이터셋 | 한국어 NLP 데이터셋 | GitHub | 대용량 | MIT | 가능 |
| 카카오엔터프라이즈 한국어 멀티턴 적대적 대화 데이터셋 | 한국어 지시문 학습 데이터셋 | GitHub | 소용량 | Apache 2.0 | 가능 |
| 한국어 수학 문장형 문제 풀이 데이터셋 | 한국어 NLP 데이터셋 | GitHub | 소용량 | MIT | 가능 |
| HateScore 한국어 다중 차원 혐오 감지 데이터셋 | 한국어 유해성 데이터셋 | GitHub | 중용량 | Apache 2.0 | 가능 |
| LIMA 한국어 고품질 극소정예 데이터셋 | 한국어 지시문 학습 데이터셋 | Hugging Face | 소용량 | CC BY-NC-SA 4.0 | 가능 |
| Zeroth 한국어 음성 인식 오픈소스 데이터셋 | 한국어 음성인식 데이터셋 | GitHub | 대용량 | Apache 2.0 | 가능 |
| MeloTTS 한국어 실시간 음성합성 데이터셋 | 한국어 TTS 데이터셋 | Hugging Face | 중용량 | MIT | 가능 |
| 한국 문화 맥락 이해 벤치마크 데이터셋 | 한국어 LLM 벤치마크 | Hugging Face (SOGANG-ISDS) | 소용량 | Apache 2.0 | 가능 |
| 한국어 교육용 필터링 웹텍스트 데이터셋 | 한국어 사전학습 코퍼스 | Hugging Face (devngho) | 대용량 | MIT | 가능 |
| 엘리스 한국어 FineWeb-Edu 데모 데이터셋 | 한국어 사전학습 코퍼스 | Hugging Face (eliceai) | 중용량 | Apache 2.0 | 가능 |
| SNU Ko-MuSR 한국어 다단계 추론 데이터셋 | 한국어 LLM 벤치마크 | Hugging Face (thunder-research-group) | 소용량 | MIT | 가능 |
| 교과서 기반 에듀케이션 한국어 말뭉치 | 한국어 지시문 학습 데이터셋 | Hugging Face (devngho) | 대용량 | MIT | 가능 |
| 한국어 이미지 정밀 묘사 데이터셋 | 한국어 비전 데이터셋 | Hugging Face (Nagase-Kotono) | 대용량 (7.85 GB) | Apache 2.0 | 가능 |
| 다양한 문체 변환 한국어 인스트럭션 | 한국어 지시문 학습 데이터셋 | Hugging Face (coastral) | 중용량 | Apache 2.0 | 가능 |
| 한국어 Function Calling 도구 사용 데이터셋 | 한국어 지시문 학습 데이터셋 | Hugging Face (gyung) | 소용량 | Apache 2.0 | 가능 |
| KOTE 한국어 온라인 댓글 감정 데이터셋 | 한국어 감성분석 데이터셋 | Hugging Face (searle-j) | 중용량 | MIT | 가능 |
| 네이버 영화 리뷰 감성 코퍼스 (NSMC) | 한국어 감성분석 데이터셋 | GitHub (e9t) | 소용량 | CC BY 2.0 | 가능 |
| 한국어 질의응답 데이터셋 1.0 (KorQuAD) | 한국어 QA 데이터셋 | KorQuAD 공식 | 중용량 | CC BY-ND 4.0 | 가능 |
| KLUE 연합뉴스 기사 제목 분류 데이터셋 | 한국어 NLP 데이터셋 | Hugging Face (KLUE) | 소용량 | CC BY-SA 4.0 | 가능 |
| KLUE 한국어 자연어 추론 데이터셋 | 한국어 NLP 데이터셋 | Hugging Face (KLUE) | 소용량 | CC BY-SA 4.0 | 가능 |
| KLUE 한국어 유사도 측정 데이터셋 | 한국어 LLM 벤치마크 | Hugging Face (KLUE) | 소용량 | CC BY-SA 4.0 | 가능 |
| KLUE 한국어 개체명 인식 데이터셋 | 한국어 개체명 데이터셋 | Hugging Face (KLUE) | 중용량 | CC BY-SA 4.0 | 가능 |
| KLUE 한국어 관계 추출 데이터셋 | 한국어 NLP 데이터셋 | Hugging Face (KLUE) | 소용량 | CC BY-SA 4.0 | 가능 |
| KLUE 한국어 기계독해 벤치마크 | 한국어 QA 데이터셋 | Hugging Face (KLUE) | 중용량 | CC BY-SA 4.0 | 가능 |
| 한국어 대규모 기계독해 데이터셋 2.0 (KorQuAD) | 한국어 QA 데이터셋 | KorQuAD 공식 | 대용량 (표 포함) | CC BY-ND 4.0 | 가능 |
| 한국어 위키백과 정제 말뭉치 | 한국어 대화 데이터셋 | GitHub | 중용량 | CC BY-SA 4.0 | 가능 |
| 한국어 속담 및 관용구 해석 데이터셋 | 한국어 NLP 데이터셋 | GitHub | 소용량 | MIT | 가능 |
| KoBEST 언어추론 벤치마크 (COPA) | 한국어 LLM 벤치마크 | Hugging Face (SKT-brain) | 소용량 | CC BY-SA 4.0 | 가능 |
| KoBEST 상황 지속성 추론 (HellaSwag) | 한국어 LLM 벤치마크 | Hugging Face (SKT-brain) | 소용량 | CC BY-SA 4.0 | 가능 |
| 실생활 한국어 비유 표현 수집 코퍼스 | 한국어 사전학습 코퍼스 | Hugging Face | 소용량 | MIT | 가능 |
| 네이버 쇼핑 상품 리뷰 감성 분석 데이터셋 | 한국어 감성분석 데이터셋 | GitHub (bab2min) | 소용량 | CC BY-SA 4.0 | 가능 |
| 스팀 한국어 게임 리뷰 감성 코퍼스 | 한국어 감성분석 데이터셋 | GitHub (bab2min) | 소용량 | CC BY-SA 4.0 | 가능 |
| 카카오브레인 KorNLI 자연어 추론 데이터셋 | 한국어 NLP 데이터셋 | GitHub (kakaobrain) | 대용량 | CC BY-SA 4.0 | 가능 |
| 카카오브레인 KorSTS 문장 유사도 데이터셋 | 한국어 NLP 데이터셋 | GitHub (kakaobrain) | 소용량 | CC BY-SA 4.0 | 가능 |
| KoBEST 단단문 참거짓 판정 (BoolQ) | 한국어 QA 데이터셋 | Hugging Face (SKT-brain) | 소용량 | CC BY-SA 4.0 | 가능 |
| KoBEST 문맥상 어휘 다의어 추론 (WiC) | 한국어 NLP 데이터셋 | Hugging Face (SKT-brain) | 소용량 | CC BY-SA 4.0 | 가능 |
| 한국어 오탈자 및 띄어쓰기 문장 교정 코퍼스 | 한국어 사전학습 코퍼스 | GitHub | 중용량 | MIT | 가능 |
| 한국어 질문 자동 생성(QG) 데이터셋 | 한국어 지시문 학습 데이터셋 | Hugging Face | 소용량 | Apache 2.0 | 가능 |
| 한국어 속담 빈칸 완성 데이터셋 | 한국어 LLM 벤치마크 | GitHub | 소용량 | MIT | 가능 |
| KMMLU-Pro 전문 지식 평가 데이터셋 | 한국어 LLM 벤치마크 | Hugging Face (LGAI-EXAONE) | 12MB | CC BY-NC 4.0 | 가능 |
| 서울대 Thunder-KoNUBench 한국어 부정문 이해 데이터셋 | 한국어 LLM 벤치마크 | Hugging Face (thunder-research-group) | 5.4MB | CC BY-NC-SA 4.0 | 가능 |
| KoSum 한국어 유튜브 멀티모달 요약 데이터셋 | 한국어 음성 데이터셋 | Hugging Face (iontail) | 45GB | CC BY-NC 4.0 | 가능 |
| K-BrowseComp 한국어 웹 브라우징 에이전트 벤치마크 | 한국어 LLM 벤치마크 | Hugging Face (prometheus-eval) | 3.5MB | MIT | 가능 |
| WanJuanSiLu 한국어 고품질 웹 텍스트 코퍼스 | 한국어 대화 데이터셋 | Hugging Face (opendatalab) | 124 GB | CC BY 4.0 | 가능 |
| KREW 한국어 페르소나 역할극(Role-Playing) 데이터셋 | 한국어 지시문 학습 데이터셋 | Hugging Face (huggingface-KREW) | 28MB | Apache 2.0 | 가능 |
| 서울대 Ko-WinoGrande 한국어 대명사 지시 추론 데이터셋 | 한국어 지시문 학습 데이터셋 | Hugging Face (thunder-research-group) | 4.2MB | CC BY 4.0 | 가능 |
| SmileStyle 한국어 다채로운 문체 변환 코퍼스 | 한국어 사전학습 코퍼스 | GitHub (smilegate-ai) | 35MB | MIT | 가능 |
| KoIn 한국 인플루언서 인물 인식 이미지 데이터셋 | 한국어 비전 데이터셋 | GitHub (dukong1) | 140 GB | MIT | 가능 |
| ToM-Diary 한국어 마음이해(Theory of Mind) 데이터셋 | 한국어 NLP 데이터셋 | GitHub | 8.5MB | Apache 2.0 | 가능 |
| KoCoSa 한국어 세부적 상식 추론 지시 데이터셋 | 한국어 지시문 학습 데이터셋 | GitHub | 18MB | Apache 2.0 | 가능 |
| KPoEM 한국어 고전 시 문학 정서 주석 데이터셋 | 한국어 감성분석 데이터셋 | GitHub | 4.2MB | MIT | 가능 |
| KMRE 한국어 임상의학 논문 관계 추출 데이터셋 | 한국어 NLP 데이터셋 | GitHub | 15MB | Apache 2.0 | 가능 |
| KoSEnd 한국어 어휘론적 함의(Entailment) 데이터셋 | 한국어 NLP 데이터셋 | GitHub | 6.2MB | Apache 2.0 | 가능 |
| Korean SAT Math 수능 수학 논리 추론 데이터셋 | 한국어 NLP 데이터셋 | Hugging Face (Quadyun) | 8.5MB | MIT | 가능 |
| KoelLabs 다국어 화자 한국어 악센트 음성 데이터셋 | 한국어 음성인식 데이터셋 | Hugging Face (KoelLabs) | 18 GB | CC BY-NC 4.0 | 가능 |
| CSAT-KOREAN-2025 대학수학능력시험 국어 데이터셋 | 한국어 QA 데이터셋 | Hugging Face (KKACHI-HUB) | 3.2MB | MIT | 가능 |
| 한국 선거 여론 및 미디어 오피니언 분석 데이터셋 | 한국어 NLP 데이터셋 | Hugging Face (AFOS-Analytics1) | 45MB | CC BY 4.0 | 가능 |
| 수능 영어 지문 한글 초고밀 번역 데이터셋 | 한국어 번역 데이터셋 | Hugging Face (cfpark00) | 5.5MB | CC BY-NC-SA 4.0 | 가능 |
| 한문 한자-한글 대칭 수동 번역 데이터셋 | 한국어 번역 데이터셋 | GitHub | 중용량 | CC0 | 가능 |
| 한국어 일반 의학 및 자가 진단 상담 데이터셋 | 한국어 NLP 데이터셋 | Hugging Face | 중용량 | Apache 2.0 | 가능 |
| 한국어 생활 법률 민원 지식 데이터셋 | 한국어 NLP 데이터셋 | Hugging Face | 중용량 | Apache 2.0 | 가능 |
| 한국어 자소-음소 변환 소리 정렬 데이터셋 | 한국어 NLP 데이터셋 | GitHub | 소용량 | MIT | 가능 |
| 네이버 NLP 챌린지 한국어 개체명 인식 데이터 | 한국어 개체명 데이터셋 | GitHub (Naver-NLP) | 중용량 | CC0 | 가능 |
| 한국어 소형 IoT 스마트홈 제어 음성 데이터 | 한국어 음성 데이터셋 | GitHub | 중용량 | Apache 2.0 | 가능 |
| 한국 전통 요리법 및 조리 순서 데이터셋 | 한국어 NLP 데이터셋 | GitHub | 소용량 | MIT | 가능 |
| 한국 방언 및 팔도 사투리 전사 메타데이터 | 한국어 음성 데이터셋 | AI Hub / GitHub | 대용량 | Apache 2.0 | 가능 |
| 한국어 주요 일간지 뉴스 생성형 요약 코퍼스 | 한국어 요약 데이터셋 | Hugging Face / AI Hub | 대용량 | Apache 2.0 | 가능 |
| 쇼핑 리뷰 어스펙트 기반 감정 분석 데이터 | 한국어 감성분석 데이터셋 | Hugging Face | 소용량 | MIT | 가능 |
| 한국어 단문 및 장문 SMS 스팸 분류 데이터셋 | 한국어 NLP 데이터셋 | GitHub | 소용량 | MIT | 가능 |
| 한국어 의문사 기반 질문 분류 데이터셋 | 한국어 NLP 데이터셋 | GitHub | 소용량 | MIT | 가능 |
| 한국인 생활 상식 및 논리적 연쇄 추론 데이터 | 한국어 LLM 벤치마크 | Hugging Face / GitHub | 중용량 | Apache 2.0 | 가능 |
| 한국 특허 정보 다국어 번역 병렬 데이터 | 한국어 번역 데이터셋 | GitHub / AI Hub | 대용량 | Apache 2.0 | 가능 |
| KoELECTRA 보캡 최적화 원시 텍스트 말뭉치 | 한국어 대화 데이터셋 | GitHub (monologg) | 대용량 (34GB) | Apache 2.0 | 가능 |
| 한국 근현대 시 문학 말뭉치 | 한국어 대화 데이터셋 | GitHub | 소용량 | MIT | 가능 |
| 한국어 반어법 및 비꼼 감정 분류 데이터셋 | 한국어 감성분석 데이터셋 | GitHub | 소용량 | MIT | 가능 |
| 한국어 금융 뉴스 감성 분석 데이터셋 | 한국어 감성분석 데이터셋 | GitHub | 소용량 | Apache 2.0 | 가능 |
| 한국어 말투 및 종결어미 스타일 변환 데이터셋 | 한국어 NLP 데이터셋 | GitHub | 중용량 | MIT | 가능 |
| 한국어 일상 스몰토크 치챗 코퍼스 | 한국어 감성분석 데이터셋 | GitHub | 중용량 | MIT | 가능 |
| 소셜 미디어 한국어 악성 텍스트 필터링 데이터 | 한국어 NLP 데이터셋 | GitHub | 중용량 | Apache 2.0 | 가능 |
| 한국어 위키피디아 기반 상식 질의응답 데이터셋 | 한국어 QA 데이터셋 | Hugging Face | 중용량 | MIT | 가능 |
| 한국어 문법성 판단 및 비문 교정 데이터셋 | 한국어 문법 평가 벤치마크 | GitHub | 소용량 | MIT | 가능 |
| 한국어 신조어 및 인터넷 밈(Meme) 해설 사전 데이터 | 한국어 NLP 데이터셋 | GitHub | 소용량 | MIT | 가능 |
| 한국어 7대 감정 음성 전사 데이터셋 | 한국어 TTS 데이터셋 | AI Hub / GitHub | 대용량 | Apache 2.0 | 가능 |
| 한국어 상식 추론 객관식 평가 벤치마크 | 한국어 LLM 벤치마크 | Hugging Face | 소용량 | Apache 2.0 | 가능 |
| 한국어 위키 개요 자동 요약 데이터셋 | 한국어 요약 데이터셋 | Hugging Face | 중용량 | CC BY-SA 4.0 | 가능 |
| 한국어 숙어 및 다어휘식 영어 번역 병렬 데이터셋 | 한국어 번역 데이터셋 | GitHub | 소용량 | MIT | 가능 |
| Ko-Llama 다각적 지시어 미세조정 데이터셋 | 한국어 지시문 학습 데이터셋 | Hugging Face | 대용량 | Apache 2.0 | 가능 |
| 한국어 이커머스 쇼핑몰 고객 의도 분류 데이터 | 한국어 NLP 데이터셋 | GitHub | 소용량 | MIT | 가능 |
| 한국어 의미상 동치 문장 판별 데이터셋 | 한국어 NLP 데이터셋 | Hugging Face | 중용량 | Apache 2.0 | 가능 |
| 한국어 금표준(Gold Standard) 개체명 인식 데이터 | 한국어 개체명 데이터셋 | GitHub | 소용량 | MIT | 가능 |
| 한국인 단어 연상 의미망 코퍼스 | 한국어 사전학습 코퍼스 | GitHub | 소용량 | MIT | 가능 |
| 한국어 전문 한자 용어 쉬운 말 풀이 코퍼스 | 한국어 사전학습 코퍼스 | Hugging Face | 소용량 | Apache 2.0 | 가능 |
| 한국어 사설 및 논설 아규먼트 마이닝 데이터셋 | 한국어 NLP 데이터셋 | GitHub | 소용량 | MIT | 가능 |
| 한국어 요식업 배달 앱 리뷰 감성 분류 데이터셋 | 한국어 감성분석 데이터셋 | GitHub | 중용량 | MIT | 가능 |
| 한국어 기초 간호 기록지 익명 명세 코퍼스 | 한국어 사전학습 코퍼스 | GitHub | 중용량 | Apache 2.0 | 가능 |
| 한국어 은유 및 시적 비유 감지 데이터셋 | 한국어 NLP 데이터셋 | GitHub | 소용량 | MIT | 가능 |
| 한국어 AI 모델 불법 및 탈옥 거부 응답 데이터셋 | 한국어 NLP 데이터셋 | Hugging Face | 소용량 | Apache 2.0 | 가능 |
| K-POP 노래 가사 다국어 번역 및 한글 로마자 | 한국어 번역 데이터셋 | GitHub | 2.5MB | 원본 확인 | 가능 |
| 유튜브 브이로그 구어체 자막 한영 다각 번역 | 한국어 번역 데이터셋 | GitHub | 18MB | 원본 확인 | 가능 |
| Ko-Agent-Trajectories-1.0 | 한국어 NLP 데이터셋 | Hugging Face | 대용량 | Apache 2.0 | 가능 |
| KoGEM — 한국어 문법 평가 벤치마크 | 한국어 문법 평가 벤치마크 | Hugging Face | 1.2MB | MIT | 가능 |
| KIT-19 — 한국어 인스트럭션 19개 태스크 | 한국어 지시문 학습 데이터셋 | Hugging Face | 85MB | CC BY 4.0 | 가능 |
| Ko-MMLU-Pro | 한국어 LLM 벤치마크 | Hugging Face | 45MB | MIT | 가능 |
| 한국어 수학 추론 데이터셋 | 한국어 NLP 데이터셋 | Hugging Face | 120MB | 원본 확인 | 가능 |
| 한국어 안전성 벤치마크 (KoSafetyBench) | 한국어 LLM 벤치마크 | Hugging Face | 15MB | CC BY 4.0 | 가능 |
| Ko-ARC Challenge | 한국어 LLM 벤치마크 | Hugging Face | 8MB | CC BY-SA 4.0 | 가능 |
| Korean Open-ORPO SFT+DPO | 한국어 지시문 학습 데이터셋 | Hugging Face | 65MB | Apache 2.0 | 가능 |
| HAE-RAE Bench 2.0 | 한국어 LLM 벤치마크 | Hugging Face | 1.0MB | MIT | 가능 |
| APEACH 한국어 혐오 표현 평가셋 | 한국어 LLM 벤치마크 | Hugging Face | 1.1MB | CC BY-SA 4.0 | 가능 |
| HRM8K (HAE-RAE Math 8K) | 한국어 LLM 벤치마크 | Hugging Face | 4.9MB | MIT | 가능 |
| K-MHaS 다중 라벨 혐오 발화 | 한국어 유해성 데이터셋 | Hugging Face | 9.1MB | CC BY-SA 4.0 | 가능 |
| K-HATERS 대상별 공격성 코퍼스 | 한국어 유해성 데이터셋 | Hugging Face | 50.5MB | CC BY 4.0 | 가능 |
| KOpen-Platypus | 한국어 지시문 학습 데이터셋 | Hugging Face | 15.9MB | CC BY 4.0 | 가능 |
| OpenAssistant Guanaco 한국어 | 한국어 지시문 학습 데이터셋 | Hugging Face | 16.7MB | Apache 2.0 | 가능 |
| HRMCR 다단계 한국 상식 추론 | 한국어 LLM 벤치마크 | Hugging Face | 106KB | Apache 2.0 | 가능 |
| KoBBQ 한국어 사회 편향 QA | 한국어 QA 데이터셋 | Hugging Face | 2.4MB | MIT | 가능 |
| K²-Eval 한국 문화 지시 평가 | 한국어 지시문 학습 데이터셋 | Hugging Face | 178KB | MIT | 가능 |
| KcBERT 사전학습 댓글 코퍼스 | 한국어 사전학습 코퍼스 | Hugging Face | 7.90 GiB | CC BY-SA 4.0 | 가능 |
| 네이버 뉴스 한국어 요약 | 한국어 요약 데이터셋 | Hugging Face | 44.4MB | Apache 2.0 | 가능 |
| OpenOrca-KO | 한국어 지시문 학습 데이터셋 | Hugging Face | 21.8MB | MIT | 가능 |
| HAE-RAE CoT 1.5M | 한국어 NLP 데이터셋 | Hugging Face | 1.05GB | CC BY 4.0 | 가능 |
| KBMC 한국어 바이오메디컬 NER | 한국어 개체명 데이터셋 | Hugging Face | 1.4MB | Apache 2.0 | 가능 |
| KorWikiTableQuestions | 한국어 QA 데이터셋 | GitHub | 70K 표 QA | CC BY-SA 4.0 | 가능 |
| FunctionChat-Bench 한국어 도구 호출 | 한국어 LLM 벤치마크 | GitHub | 500 단일턴 + 45 멀티턴 | Apache 2.0 | 가능 |
| Jejueo JIT/JSS 제주어 병렬·음성 | 한국어 번역 데이터셋 | GitHub | 170K+ 병렬 문장, 10K 음성 | Apache 2.0 | 가능 |
| ParaKQC 한국어 질문·명령 병렬 | 한국어 NLP 데이터셋 | GitHub | 10,000 발화 (v1) | CC BY-SA 4.0 | 가능 |