AI Dataset Discovery라이선스 · 출처 · 한국어 데이터셋
한국어 AI 데이터셋 · 라이선스·용량·원본 다운로드

한국어 AI 데이터셋 286개,
라이선스·용량·원본 다운로드까지

KoBEST, KMMLU, KsponSpeech, 영수증 OCR까지 — 라이선스·용량·샘플 수를 확인하고 원본에서 내려받습니다.GearDel(기어델)은 한국어 NLP·음성·비전 데이터셋을 찾아보는 카탈로그입니다. 파일은 보관하지 않습니다.

/llms.txt · /data/index.json · x402 API — 인덱스는 무료, 원본 주소·검색은 Base USDC(x402).

검색 예

카탈로그에서 센 값

기어델에 올라 있는 286개 행을 칸별로 센 결과

다운로드 수, 인용 수, 모델 점수가 아닙니다. 상업 이용 가능 표기도 법률 허가가 아닙니다. 받기 전에 원본 약관을 읽습니다.

상업 이용 가능
161
상업 이용 조건부
120
상업 이용 제한
5
라이선스 칸 확인됨
182

유형

  • 텍스트215
  • 음성38
  • 이미지33

제공처 칸

한 행은 한 칸에만 넣습니다. 순서는 AI Hub, Hugging Face, GitHub, 국립국어원, 그 외입니다.

  • AI Hub96
  • Hugging Face112
  • GitHub69
  • 국립국어원7
  • 그 외2

이름으로 자주 찾는 행

검색은 첫 페이지 다음에 카탈로그 286개를 불러옵니다. 크롤러용 전체 목록은 /catalog입니다. 파일은 기어델이 보관하지 않습니다.

286개 중 12개

확인됨 표시는 필드별 카탈로그 상태입니다. 모든 항목이 확인된 것은 아닙니다.

💬
텍스트한국어Text벤치마크LLM

KMMLU

인문·사회부터 STEM까지 45개 분야의 한국어 객관식 LLM 평가 데이터셋입니다.


제공처Hugging Face
용량70.7 MB
형식Text
라이선스CC BY-ND 4.0
원본 확인됨라이선스 확인됨
⚖
텍스트한국어Text벤치마크NLU

KLUE Benchmark

한국어 언어 이해를 평가하는 8개 과제(분류·NER·관계 추출·QA 등) 벤치마크입니다.


제공처Hugging Face
용량62.3 MB
형식Text
라이선스CC BY-SA 4.0
원본 확인됨라이선스 확인됨
✍
텍스트한국어Text공공표준어

모두의 말뭉치: 뉴스

문체 및 공적 어법 준수, 시사 지식 확충을 위한 대한민국 최대의 정제 신문 말뭉치 자원입니다.


제공처국립국어원
용량대용량
형식Text
라이선스국립국어원 사용서약
원본 미확인라이선스 확인됨
✍
텍스트한국어Text메신저공공

모두의 말뭉치: 메신저

현실 실생활 줄임말, 자음 위주의 구어 표현을 구조적으로 학습하기 위한 모바일 메신저 전사 말뭉치입니다.


제공처국립국어원
용량3.5MB
형식Text
라이선스국립국어원 사용서약
원본 미확인라이선스 확인됨
📰
텍스트한국어Text공공일상대화

모두의 말뭉치: 일상 대화

다양한 주제에 대한 일반 대중의 일상 대화를 정제한 말뭉치 데이터셋입니다.


제공처국립국어원
용량24.5MB
형식Text
라이선스국립국어원 사용서약
원본 미확인라이선스 확인됨
📖
텍스트한국어Text혐오표현안전성

BEEP! Korean Hate Speech

국내 온라인 포털 뉴스의 댓글 자원을 고정밀 분석하여 혐오 및 성희롱 편향을 수작업 감수한 리소스입니다.


제공처GitHub
용량1.2MB
형식Text
라이선스CC BY-SA 4.0
원본 확인됨라이선스 확인됨
🔍
텍스트한국어Text벤치마크문화지식

CLIcK (Cultural & Legal Knowledge)

한국의 고유 풍습, 명절, 일상 행정 규율 등을 LLM이 얼마나 정확하게 아는지 검정하는 시험 데이터셋입니다.


제공처GitHub
용량5.5MB
형식Text
라이선스라이선스 미확인
원본 확인됨라이선스 미확인
📖
텍스트한국어Text보안협박탐지

DKTC (Dataset of Korean Threat Dialogue)

금전 갈취, 신체적 무력 협박, 심리적 가스라이팅 지배 대화를 차단하기 위한 분류 주석 데이터입니다.


제공처GitHub
용량1.8MB
형식Text
라이선스CC BY-NC-SA 4.0
원본 확인됨라이선스 확인됨
✦
텍스트한국어Text전문 분야QA

GovOn Legal Response Dataset

법률 해석과 근거 인용을 위한 한국어 instruction-tuning 데이터셋입니다.


제공처Hugging Face
용량267 MB
형식Text
라이선스CC BY 4.0
원본 확인됨라이선스 확인됨
✦
텍스트한국어Text인기지시문

KoAlpaca-v1.1a

네이버 지식인 정제 데이터 기반의 실생활 맥락 및 가이드라인 학습용 지시어 데이터셋입니다.


제공처Hugging Face
용량대용량
형식Text
라이선스라이선스 미확인
원본 확인됨라이선스 미확인
🔍
텍스트한국어Text인기LLM

KULLM-v2 (한국어 지시문)

GPT4ALL, Dolly, Vicuna 데이터를 한국어로 번역한 지시문 학습 데이터셋입니다.


제공처Hugging Face
용량180MB
형식Text
라이선스Apache 2.0
원본 확인됨라이선스 확인됨

External Data Resources

External Korean NLP corpus lists

Beyond the GearDel catalog, these public lists on GitHub and blogs are useful references.

Suggested
한국어 AI 데이터셋

한국어 AI 데이터셋,
과제·라이선스·원본부터 봅니다.

음성, OCR, 벤치마크 모음을 먼저 열고, 라이선스 표기를 본 뒤 원본 제공처로 이동합니다.

01

한국어 음성·OCR·벤치마크

음성 인식과 합성은 다릅니다. 영수증 OCR과 장면 글자도 다릅니다. KLUE 계열은 평가용입니다.

02

한국어 데이터셋 라이선스

기어델의 상업 이용 가능은 힌트입니다. AI Hub 이용안내는 MIT가 아닙니다.

03

원본에서 내려받기

제공처·원본 주소·용량 표기를 본 뒤 원본에서 받습니다. 기어델은 파일을 두지 않습니다.

자세히: 데이터셋 고르는 법 →·라이선스 비교 →·자주 묻는 질문 →·기어델 소개 →