모음

가입 없이 받기 쉬운 한국어 데이터셋

157 · GearDel

기어델 카탈로그에서 이 주제는 157개입니다 (텍스트 143개, 음성 6개, 이미지 8개). 제공처: Hugging Face 62개, GitHub 52개. 예: KULLM-v2 (한국어 지시문), GovOn Legal Response Dataset, KoAlpaca-v1.1a. 상업 이용 가능 표기는 157개입니다. 카탈로그의 상업 이용 표기는 힌트입니다. 제품에 쓰기 전에 제공처 약관을 다시 읽으세요. 기어델은 파일을 호스팅하지 않으니 원본 링크에서 받으세요.

가능 표기 157개, 조건부·제한 0개입니다. AI Hub·국립국어원은 여기 있어도 별도 약관이 거의 항상 있습니다.

이름용도제공처크기라이선스상업이용
KULLM-v2 (한국어 지시문)한국어 지시문 학습 데이터셋Hugging Face180MBApache 2.0가능
GovOn Legal Response Dataset한국어 QA 데이터셋Hugging Face267 MBCC BY 4.0가능
KoAlpaca-v1.1a한국어 지시문 학습 데이터셋Hugging Face대용량원본 확인가능
CLIcK (Cultural & Legal Knowledge)한국어 LLM 벤치마크GitHub5.5MB원본 확인가능
KoBEST 언어 추론 벤치마크한국어 LLM 벤치마크Hugging Face5.1MBCC BY-SA 4.0가능
GSM8K 한국어 번역 수학 데이터셋한국어 번역 데이터셋Hugging Face4.8MBMIT가능
KoBigBench Lite한국어 LLM 벤치마크Hugging Face12MB원본 확인가능
KoGPT2 기본 사전학습 코퍼스한국어 사전학습 코퍼스Hugging Face3.2GB원본 확인가능
Speech Emotion Dataset (ko)한국어 음성 데이터셋GitHub3.2GB원본 확인가능
COYO-700M (카카오브레인)한국어 비전 데이터셋Hugging Face대용량 (7억 쌍)CC BY 4.0가능
KRETA (Korean Rich Text Visual QA)한국어 OCR 데이터셋Hugging Face125MB원본 확인가능
Korean Tourist Spot Dataset (풍경 이미지)한국어 비전 데이터셋GitHub8.4GB원본 확인가능
Korean-Light-OCR (야외 간판 및 표지판)한국어 OCR 데이터셋GitHub4.2GB원본 확인가능
Korean Receipts (금융 영수증 OCR)영수증 OCR 데이터셋Hugging Face95MBCC BY 4.0가능
Table-VQA-ko (스캔문서 표 판독)한국어 OCR 데이터셋Hugging Face185MBApache 2.0가능
TyDi-QA (ko) (구글 다국어 질의응답)한국어 QA 데이터셋GitHub18.5MBApache 2.0가능
Open Subtitles (ko-en) (자막 번역)한국어 번역 데이터셋GitHub대용량원본 확인가능
Tatoeba (ko-en)한국어 번역 데이터셋GitHub3.4MBCC BY 2.0가능
TinyStories 한국어 번역 데이터셋한국어 번역 데이터셋Hugging Face대용량MIT가능
KoInFoBench 한국어 지시어 이행 평가 데이터셋한국어 지시문 학습 데이터셋Hugging Face소용량MIT가능
한국어 사전학습 위키 코퍼스한국어 사전학습 코퍼스Hugging Face중용량MIT가능
오픈 한국어 인스트럭션 데이터셋한국어 지시문 학습 데이터셋Hugging Face대용량MIT가능
청와대 국민청원 데이터셋한국어 NLP 데이터셋Hugging Face대용량MIT가능
QARV 한국어 인스트럭션 데이터셋한국어 지시문 학습 데이터셋Hugging Face중용량MIT가능
Orca 한국어 DPO 선호도 데이터셋한국어 NLP 데이터셋Hugging Face중용량Apache 2.0가능
KOpen 고품질 에르메스 한국어 데이터셋한국어 번역 데이터셋Hugging Face중용량MIT가능
한국어 상업용 지시어 데이터셋한국어 지시문 학습 데이터셋Hugging Face대용량MIT가능
캐럿AI 한국어 지시어 데이터셋한국어 지시문 학습 데이터셋Hugging Face소용량Apache 2.0가능
한국어 다단계 논리 추론 데이터셋한국어 QA 데이터셋Hugging Face소용량Apache 2.0가능
한국어 금융 특화 지시어 데이터셋한국어 지시문 학습 데이터셋Hugging Face중용량MIT가능
한국어 일상 구어체 대화 데이터셋한국어 대화 데이터셋Hugging Face대용량Apache 2.0가능
송영숙 한국어 챗봇 문답 데이터셋한국어 감성분석 데이터셋GitHub소용량MIT가능
한국어 온라인 댓글 욕설 탐지 데이터셋한국어 유해성 데이터셋GitHub소용량MIT가능
한국어 인공 교과서 코퍼스 데이터셋한국어 사전학습 코퍼스Hugging Face대용량Apache 2.0가능
SQuARe 한국어 민감 주제 안전성 데이터셋한국어 NLP 데이터셋GitHub중용량MIT가능
KoSBi 한국어 편향성 완화 데이터셋한국어 NLP 데이터셋GitHub대용량MIT가능
카카오엔터프라이즈 한국어 멀티턴 적대적 대화 데이터셋한국어 지시문 학습 데이터셋GitHub소용량Apache 2.0가능
한국어 수학 문장형 문제 풀이 데이터셋한국어 NLP 데이터셋GitHub소용량MIT가능
HateScore 한국어 다중 차원 혐오 감지 데이터셋한국어 유해성 데이터셋GitHub중용량Apache 2.0가능
LIMA 한국어 고품질 극소정예 데이터셋한국어 지시문 학습 데이터셋Hugging Face소용량CC BY-NC-SA 4.0가능
Zeroth 한국어 음성 인식 오픈소스 데이터셋한국어 음성인식 데이터셋GitHub대용량Apache 2.0가능
MeloTTS 한국어 실시간 음성합성 데이터셋한국어 TTS 데이터셋Hugging Face중용량MIT가능
한국 문화 맥락 이해 벤치마크 데이터셋한국어 LLM 벤치마크Hugging Face (SOGANG-ISDS)소용량Apache 2.0가능
한국어 교육용 필터링 웹텍스트 데이터셋한국어 사전학습 코퍼스Hugging Face (devngho)대용량MIT가능
엘리스 한국어 FineWeb-Edu 데모 데이터셋한국어 사전학습 코퍼스Hugging Face (eliceai)중용량Apache 2.0가능
SNU Ko-MuSR 한국어 다단계 추론 데이터셋한국어 LLM 벤치마크Hugging Face (thunder-research-group)소용량MIT가능
교과서 기반 에듀케이션 한국어 말뭉치한국어 지시문 학습 데이터셋Hugging Face (devngho)대용량MIT가능
한국어 이미지 정밀 묘사 데이터셋한국어 비전 데이터셋Hugging Face (Nagase-Kotono)대용량 (7.85 GB)Apache 2.0가능
다양한 문체 변환 한국어 인스트럭션한국어 지시문 학습 데이터셋Hugging Face (coastral)중용량Apache 2.0가능
한국어 Function Calling 도구 사용 데이터셋한국어 지시문 학습 데이터셋Hugging Face (gyung)소용량Apache 2.0가능
KOTE 한국어 온라인 댓글 감정 데이터셋한국어 감성분석 데이터셋Hugging Face (searle-j)중용량MIT가능
네이버 영화 리뷰 감성 코퍼스 (NSMC)한국어 감성분석 데이터셋GitHub (e9t)소용량CC BY 2.0가능
한국어 질의응답 데이터셋 1.0 (KorQuAD)한국어 QA 데이터셋KorQuAD 공식중용량CC BY-ND 4.0가능
KLUE 연합뉴스 기사 제목 분류 데이터셋한국어 NLP 데이터셋Hugging Face (KLUE)소용량CC BY-SA 4.0가능
KLUE 한국어 자연어 추론 데이터셋한국어 NLP 데이터셋Hugging Face (KLUE)소용량CC BY-SA 4.0가능
KLUE 한국어 유사도 측정 데이터셋한국어 LLM 벤치마크Hugging Face (KLUE)소용량CC BY-SA 4.0가능
KLUE 한국어 개체명 인식 데이터셋한국어 개체명 데이터셋Hugging Face (KLUE)중용량CC BY-SA 4.0가능
KLUE 한국어 관계 추출 데이터셋한국어 NLP 데이터셋Hugging Face (KLUE)소용량CC BY-SA 4.0가능
KLUE 한국어 기계독해 벤치마크한국어 QA 데이터셋Hugging Face (KLUE)중용량CC BY-SA 4.0가능
한국어 대규모 기계독해 데이터셋 2.0 (KorQuAD)한국어 QA 데이터셋KorQuAD 공식대용량 (표 포함)CC BY-ND 4.0가능
한국어 위키백과 정제 말뭉치한국어 대화 데이터셋GitHub중용량CC BY-SA 4.0가능
한국어 속담 및 관용구 해석 데이터셋한국어 NLP 데이터셋GitHub소용량MIT가능
KoBEST 언어추론 벤치마크 (COPA)한국어 LLM 벤치마크Hugging Face (SKT-brain)소용량CC BY-SA 4.0가능
KoBEST 상황 지속성 추론 (HellaSwag)한국어 LLM 벤치마크Hugging Face (SKT-brain)소용량CC BY-SA 4.0가능
실생활 한국어 비유 표현 수집 코퍼스한국어 사전학습 코퍼스Hugging Face소용량MIT가능
네이버 쇼핑 상품 리뷰 감성 분석 데이터셋한국어 감성분석 데이터셋GitHub (bab2min)소용량CC BY-SA 4.0가능
스팀 한국어 게임 리뷰 감성 코퍼스한국어 감성분석 데이터셋GitHub (bab2min)소용량CC BY-SA 4.0가능
카카오브레인 KorNLI 자연어 추론 데이터셋한국어 NLP 데이터셋GitHub (kakaobrain)대용량CC BY-SA 4.0가능
카카오브레인 KorSTS 문장 유사도 데이터셋한국어 NLP 데이터셋GitHub (kakaobrain)소용량CC BY-SA 4.0가능
KoBEST 단단문 참거짓 판정 (BoolQ)한국어 QA 데이터셋Hugging Face (SKT-brain)소용량CC BY-SA 4.0가능
KoBEST 문맥상 어휘 다의어 추론 (WiC)한국어 NLP 데이터셋Hugging Face (SKT-brain)소용량CC BY-SA 4.0가능
한국어 오탈자 및 띄어쓰기 문장 교정 코퍼스한국어 사전학습 코퍼스GitHub중용량MIT가능
한국어 질문 자동 생성(QG) 데이터셋한국어 지시문 학습 데이터셋Hugging Face소용량Apache 2.0가능
한국어 속담 빈칸 완성 데이터셋한국어 LLM 벤치마크GitHub소용량MIT가능
KMMLU-Pro 전문 지식 평가 데이터셋한국어 LLM 벤치마크Hugging Face (LGAI-EXAONE)12MBCC BY-NC 4.0가능
서울대 Thunder-KoNUBench 한국어 부정문 이해 데이터셋한국어 LLM 벤치마크Hugging Face (thunder-research-group)5.4MBCC BY-NC-SA 4.0가능
KoSum 한국어 유튜브 멀티모달 요약 데이터셋한국어 음성 데이터셋Hugging Face (iontail)45GBCC BY-NC 4.0가능
K-BrowseComp 한국어 웹 브라우징 에이전트 벤치마크한국어 LLM 벤치마크Hugging Face (prometheus-eval)3.5MBMIT가능
WanJuanSiLu 한국어 고품질 웹 텍스트 코퍼스한국어 대화 데이터셋Hugging Face (opendatalab)124 GBCC BY 4.0가능
KREW 한국어 페르소나 역할극(Role-Playing) 데이터셋한국어 지시문 학습 데이터셋Hugging Face (huggingface-KREW)28MBApache 2.0가능
서울대 Ko-WinoGrande 한국어 대명사 지시 추론 데이터셋한국어 지시문 학습 데이터셋Hugging Face (thunder-research-group)4.2MBCC BY 4.0가능
SmileStyle 한국어 다채로운 문체 변환 코퍼스한국어 사전학습 코퍼스GitHub (smilegate-ai)35MBMIT가능
KoIn 한국 인플루언서 인물 인식 이미지 데이터셋한국어 비전 데이터셋GitHub (dukong1)140 GBMIT가능
ToM-Diary 한국어 마음이해(Theory of Mind) 데이터셋한국어 NLP 데이터셋GitHub8.5MBApache 2.0가능
KoCoSa 한국어 세부적 상식 추론 지시 데이터셋한국어 지시문 학습 데이터셋GitHub18MBApache 2.0가능
KPoEM 한국어 고전 시 문학 정서 주석 데이터셋한국어 감성분석 데이터셋GitHub4.2MBMIT가능
KMRE 한국어 임상의학 논문 관계 추출 데이터셋한국어 NLP 데이터셋GitHub15MBApache 2.0가능
KoSEnd 한국어 어휘론적 함의(Entailment) 데이터셋한국어 NLP 데이터셋GitHub6.2MBApache 2.0가능
Korean SAT Math 수능 수학 논리 추론 데이터셋한국어 NLP 데이터셋Hugging Face (Quadyun)8.5MBMIT가능
KoelLabs 다국어 화자 한국어 악센트 음성 데이터셋한국어 음성인식 데이터셋Hugging Face (KoelLabs)18 GBCC BY-NC 4.0가능
CSAT-KOREAN-2025 대학수학능력시험 국어 데이터셋한국어 QA 데이터셋Hugging Face (KKACHI-HUB)3.2MBMIT가능
한국 선거 여론 및 미디어 오피니언 분석 데이터셋한국어 NLP 데이터셋Hugging Face (AFOS-Analytics1)45MBCC BY 4.0가능
수능 영어 지문 한글 초고밀 번역 데이터셋한국어 번역 데이터셋Hugging Face (cfpark00)5.5MBCC BY-NC-SA 4.0가능
한문 한자-한글 대칭 수동 번역 데이터셋한국어 번역 데이터셋GitHub중용량CC0가능
한국어 일반 의학 및 자가 진단 상담 데이터셋한국어 NLP 데이터셋Hugging Face중용량Apache 2.0가능
한국어 생활 법률 민원 지식 데이터셋한국어 NLP 데이터셋Hugging Face중용량Apache 2.0가능
한국어 자소-음소 변환 소리 정렬 데이터셋한국어 NLP 데이터셋GitHub소용량MIT가능
네이버 NLP 챌린지 한국어 개체명 인식 데이터한국어 개체명 데이터셋GitHub (Naver-NLP)중용량CC0가능
한국어 소형 IoT 스마트홈 제어 음성 데이터한국어 음성 데이터셋GitHub중용량Apache 2.0가능
한국 전통 요리법 및 조리 순서 데이터셋한국어 NLP 데이터셋GitHub소용량MIT가능
쇼핑 리뷰 어스펙트 기반 감정 분석 데이터한국어 감성분석 데이터셋Hugging Face소용량MIT가능
한국어 단문 및 장문 SMS 스팸 분류 데이터셋한국어 NLP 데이터셋GitHub소용량MIT가능
한국어 의문사 기반 질문 분류 데이터셋한국어 NLP 데이터셋GitHub소용량MIT가능
한국인 생활 상식 및 논리적 연쇄 추론 데이터한국어 LLM 벤치마크Hugging Face / GitHub중용량Apache 2.0가능
KoELECTRA 보캡 최적화 원시 텍스트 말뭉치한국어 대화 데이터셋GitHub (monologg)대용량 (34GB)Apache 2.0가능
한국 근현대 시 문학 말뭉치한국어 대화 데이터셋GitHub소용량MIT가능
한국어 반어법 및 비꼼 감정 분류 데이터셋한국어 감성분석 데이터셋GitHub소용량MIT가능
한국어 금융 뉴스 감성 분석 데이터셋한국어 감성분석 데이터셋GitHub소용량Apache 2.0가능
한국어 말투 및 종결어미 스타일 변환 데이터셋한국어 NLP 데이터셋GitHub중용량MIT가능
한국어 일상 스몰토크 치챗 코퍼스한국어 감성분석 데이터셋GitHub중용량MIT가능
소셜 미디어 한국어 악성 텍스트 필터링 데이터한국어 NLP 데이터셋GitHub중용량Apache 2.0가능
한국어 위키피디아 기반 상식 질의응답 데이터셋한국어 QA 데이터셋Hugging Face중용량MIT가능
한국어 문법성 판단 및 비문 교정 데이터셋한국어 문법 평가 벤치마크GitHub소용량MIT가능
한국어 신조어 및 인터넷 밈(Meme) 해설 사전 데이터한국어 NLP 데이터셋GitHub소용량MIT가능
한국어 상식 추론 객관식 평가 벤치마크한국어 LLM 벤치마크Hugging Face소용량Apache 2.0가능
한국어 위키 개요 자동 요약 데이터셋한국어 요약 데이터셋Hugging Face중용량CC BY-SA 4.0가능
한국어 숙어 및 다어휘식 영어 번역 병렬 데이터셋한국어 번역 데이터셋GitHub소용량MIT가능
Ko-Llama 다각적 지시어 미세조정 데이터셋한국어 지시문 학습 데이터셋Hugging Face대용량Apache 2.0가능
한국어 이커머스 쇼핑몰 고객 의도 분류 데이터한국어 NLP 데이터셋GitHub소용량MIT가능
한국어 의미상 동치 문장 판별 데이터셋한국어 NLP 데이터셋Hugging Face중용량Apache 2.0가능
한국어 금표준(Gold Standard) 개체명 인식 데이터한국어 개체명 데이터셋GitHub소용량MIT가능
한국인 단어 연상 의미망 코퍼스한국어 사전학습 코퍼스GitHub소용량MIT가능
한국어 전문 한자 용어 쉬운 말 풀이 코퍼스한국어 사전학습 코퍼스Hugging Face소용량Apache 2.0가능
한국어 사설 및 논설 아규먼트 마이닝 데이터셋한국어 NLP 데이터셋GitHub소용량MIT가능
한국어 요식업 배달 앱 리뷰 감성 분류 데이터셋한국어 감성분석 데이터셋GitHub중용량MIT가능
한국어 기초 간호 기록지 익명 명세 코퍼스한국어 사전학습 코퍼스GitHub중용량Apache 2.0가능
한국어 은유 및 시적 비유 감지 데이터셋한국어 NLP 데이터셋GitHub소용량MIT가능
한국어 AI 모델 불법 및 탈옥 거부 응답 데이터셋한국어 NLP 데이터셋Hugging Face소용량Apache 2.0가능
K-POP 노래 가사 다국어 번역 및 한글 로마자한국어 번역 데이터셋GitHub2.5MB원본 확인가능
유튜브 브이로그 구어체 자막 한영 다각 번역한국어 번역 데이터셋GitHub18MB원본 확인가능
Ko-Agent-Trajectories-1.0한국어 NLP 데이터셋Hugging Face대용량Apache 2.0가능
KoGEM — 한국어 문법 평가 벤치마크한국어 문법 평가 벤치마크Hugging Face1.2MBMIT가능
KIT-19 — 한국어 인스트럭션 19개 태스크한국어 지시문 학습 데이터셋Hugging Face85MBCC BY 4.0가능
Ko-MMLU-Pro한국어 LLM 벤치마크Hugging Face45MBMIT가능
한국어 수학 추론 데이터셋한국어 NLP 데이터셋Hugging Face120MB원본 확인가능
한국어 안전성 벤치마크 (KoSafetyBench)한국어 LLM 벤치마크Hugging Face15MBCC BY 4.0가능
Ko-ARC Challenge한국어 LLM 벤치마크Hugging Face8MBCC BY-SA 4.0가능
Korean Open-ORPO SFT+DPO한국어 지시문 학습 데이터셋Hugging Face65MBApache 2.0가능
HAE-RAE Bench 2.0한국어 LLM 벤치마크Hugging Face1.0MBMIT가능
APEACH 한국어 혐오 표현 평가셋한국어 LLM 벤치마크Hugging Face1.1MBCC BY-SA 4.0가능
HRM8K (HAE-RAE Math 8K)한국어 LLM 벤치마크Hugging Face4.9MBMIT가능
K-MHaS 다중 라벨 혐오 발화한국어 유해성 데이터셋Hugging Face9.1MBCC BY-SA 4.0가능
K-HATERS 대상별 공격성 코퍼스한국어 유해성 데이터셋Hugging Face50.5MBCC BY 4.0가능
KOpen-Platypus한국어 지시문 학습 데이터셋Hugging Face15.9MBCC BY 4.0가능
OpenAssistant Guanaco 한국어한국어 지시문 학습 데이터셋Hugging Face16.7MBApache 2.0가능
HRMCR 다단계 한국 상식 추론한국어 LLM 벤치마크Hugging Face106KBApache 2.0가능
KoBBQ 한국어 사회 편향 QA한국어 QA 데이터셋Hugging Face2.4MBMIT가능
K²-Eval 한국 문화 지시 평가한국어 지시문 학습 데이터셋Hugging Face178KBMIT가능
KcBERT 사전학습 댓글 코퍼스한국어 사전학습 코퍼스Hugging Face7.90 GiBCC BY-SA 4.0가능
네이버 뉴스 한국어 요약한국어 요약 데이터셋Hugging Face44.4MBApache 2.0가능
OpenOrca-KO한국어 지시문 학습 데이터셋Hugging Face21.8MBMIT가능
HAE-RAE CoT 1.5M한국어 NLP 데이터셋Hugging Face1.05GBCC BY 4.0가능
KBMC 한국어 바이오메디컬 NER한국어 개체명 데이터셋Hugging Face1.4MBApache 2.0가능
KorWikiTableQuestions한국어 QA 데이터셋GitHub70K 표 QACC BY-SA 4.0가능
FunctionChat-Bench 한국어 도구 호출한국어 LLM 벤치마크GitHub500 단일턴 + 45 멀티턴Apache 2.0가능
Jejueo JIT/JSS 제주어 병렬·음성한국어 번역 데이터셋GitHub170K+ 병렬 문장, 10K 음성Apache 2.0가능
ParaKQC 한국어 질문·명령 병렬한국어 NLP 데이터셋GitHub10,000 발화 (v1)CC BY-SA 4.0가능

다른 모음