KMMLU
인문·사회부터 STEM까지 45개 분야의 한국어 객관식 LLM 평가 데이터셋입니다.
KoBEST, KMMLU, KsponSpeech, 영수증 OCR까지 — 라이선스·용량·샘플 수를 확인하고 원본에서 내려받습니다.
GearDel(기어델)은 한국어 NLP·음성·비전 데이터셋을 찾아보는 카탈로그입니다. 파일은 보관하지 않습니다.
/llms.txt · /data/index.json · x402 API — 인덱스는 무료, 원본 주소·검색은 Base USDC(x402).
벤치마크, 지시문, 음성 파일은 한 번에 받을 데이터가 아닙니다. 과제를 고른 뒤 라이선스와 원본 주소를 확인합니다.
지시문 학습
질문과 답, 지시와 응답이 있는 데이터입니다. 웹 말뭉치를 대체하지 않습니다.
벤치마크
KLUE, KoBEST, KMMLU처럼 점수를 매기는 데이터입니다. 시험 문항으로 학습하지 않습니다.
음성 인식
음성을 글로 옮기는 데이터입니다. 성우가 읽은 합성용과 다릅니다.
음성 합성
글을 음성으로 만드는 쪽에 가깝습니다. 자유발화 인식 데이터가 아닙니다.
OCR
글자가 있는 이미지입니다. 일반 사진 분류 데이터와 다릅니다.
사전학습 말뭉치
뉴스, 웹, 도서처럼 긴 텍스트입니다. 지시문 형식이 아닐 수 있습니다.
대화
주고받는 말풍선에 가깝습니다. 지시 학습 포맷이 아닐 수 있습니다.
감성 분석
긍정·부정처럼 라벨이 붙은 문장입니다. 생성용 지시문과 다릅니다.
카탈로그에서 센 값
다운로드 수, 인용 수, 모델 점수가 아닙니다. 상업 이용 가능 표기도 법률 허가가 아닙니다. 받기 전에 원본 약관을 읽습니다.
한 행은 한 칸에만 넣습니다. 순서는 AI Hub, Hugging Face, GitHub, 국립국어원, 그 외입니다.
검색은 첫 페이지 다음에 카탈로그 286개를 불러옵니다. 크롤러용 전체 목록은 /catalog입니다. 파일은 기어델이 보관하지 않습니다.
AI Hub, Hugging Face, GitHub, 국립국어원 한국어 데이터셋을 출처·라이선스·용량으로 비교합니다. 기어델은 파일을 보관하지 않습니다.
286개 중 12개
확인됨 표시는 필드별 카탈로그 상태입니다. 모든 항목이 확인된 것은 아닙니다.
인문·사회부터 STEM까지 45개 분야의 한국어 객관식 LLM 평가 데이터셋입니다.
한국어 언어 이해를 평가하는 8개 과제(분류·NER·관계 추출·QA 등) 벤치마크입니다.
문체 및 공적 어법 준수, 시사 지식 확충을 위한 대한민국 최대의 정제 신문 말뭉치 자원입니다.
현실 실생활 줄임말, 자음 위주의 구어 표현을 구조적으로 학습하기 위한 모바일 메신저 전사 말뭉치입니다.
다양한 주제에 대한 일반 대중의 일상 대화를 정제한 말뭉치 데이터셋입니다.
대화 원문과 한 문장 요약문으로 구성된 한국어 대화 요약 학습 데이터입니다.
국내 온라인 포털 뉴스의 댓글 자원을 고정밀 분석하여 혐오 및 성희롱 편향을 수작업 감수한 리소스입니다.
한국의 고유 풍습, 명절, 일상 행정 규율 등을 LLM이 얼마나 정확하게 아는지 검정하는 시험 데이터셋입니다.
금전 갈취, 신체적 무력 협박, 심리적 가스라이팅 지배 대화를 차단하기 위한 분류 주석 데이터입니다.
법률 해석과 근거 인용을 위한 한국어 instruction-tuning 데이터셋입니다.
네이버 지식인 정제 데이터 기반의 실생활 맥락 및 가이드라인 학습용 지시어 데이터셋입니다.
GPT4ALL, Dolly, Vicuna 데이터를 한국어로 번역한 지시문 학습 데이터셋입니다.
External Data Resources
Beyond the GearDel catalog, these public lists on GitHub and blogs are useful references.
음성, OCR, 벤치마크 모음을 먼저 열고, 라이선스 표기를 본 뒤 원본 제공처로 이동합니다.
음성 인식과 합성은 다릅니다. 영수증 OCR과 장면 글자도 다릅니다. KLUE 계열은 평가용입니다.
기어델의 상업 이용 가능은 힌트입니다. AI Hub 이용안내는 MIT가 아닙니다.
제공처·원본 주소·용량 표기를 본 뒤 원본에서 받습니다. 기어델은 파일을 두지 않습니다.