모음
한국어 AI 데이터셋 카탈로그
286 개 · GearDel
기어델 카탈로그에서 이 주제는 286개입니다 (텍스트 215개, 음성 38개, 이미지 33개). 제공처: Hugging Face 79개, AI Hub 92개, GitHub 60개. 예: 한국어 대화 요약 데이터셋, KULLM-v2 (한국어 지시문), GovOn Legal Response Dataset. 상업 이용 가능 표기는 161개입니다. 기어델은 파일을 호스팅하지 않으니 원본 링크에서 받으세요.
받기 전에 라이선스와 제공처를 비교하세요. 286개 중 161개가 상업 이용 가능 표기입니다.
| 이름 | 용도 | 제공처 | 크기 | 라이선스 | 상업이용 |
|---|---|---|---|---|---|
| 한국어 대화 요약 데이터셋 | 한국어 요약 데이터셋 | AI Hub | 대용량 | AI Hub 이용안내 | 조건부 가능 |
| KULLM-v2 (한국어 지시문) | 한국어 지시문 학습 데이터셋 | Hugging Face | 180MB | Apache 2.0 | 가능 |
| GovOn Legal Response Dataset | 한국어 QA 데이터셋 | Hugging Face | 267 MB | CC BY 4.0 | 가능 |
| KLUE Benchmark | 한국어 LLM 벤치마크 | Hugging Face | 62.3 MB | CC BY-SA 4.0 | 조건부 가능 |
| KMMLU | 한국어 LLM 벤치마크 | Hugging Face | 70.7 MB | CC BY-ND 4.0 | 불가 |
| KoAlpaca-v1.1a | 한국어 지시문 학습 데이터셋 | Hugging Face | 대용량 | 원본 확인 | 가능 |
| CLIcK (Cultural & Legal Knowledge) | 한국어 LLM 벤치마크 | GitHub | 5.5MB | 원본 확인 | 가능 |
| BEEP! Korean Hate Speech | 한국어 유해성 데이터셋 | GitHub | 1.2MB | CC BY-SA 4.0 | 조건부 가능 |
| DKTC (Dataset of Korean Threat Dialogue) | 한국어 대화 데이터셋 | GitHub | 1.8MB | CC BY-NC-SA 4.0 | 불가 |
| 모두의 말뭉치: 뉴스 | 한국어 대화 데이터셋 | 국립국어원 | 대용량 | 국립국어원 사용서약 | 조건부 가능 |
| 모두의 말뭉치: 메신저 | 한국어 대화 데이터셋 | 국립국어원 | 3.5MB | 국립국어원 사용서약 | 조건부 가능 |
| 모두의 말뭉치: 일상 대화 | 한국어 대화 데이터셋 | 국립국어원 | 24.5MB | 국립국어원 사용서약 | 조건부 가능 |
| 모두의 말뭉치: 웹 문서 | 한국어 대화 데이터셋 | 국립국어원 | 1.2GB | 국립국어원 사용서약 | 조건부 가능 |
| 모두의 말뭉치: 구어 | 한국어 대화 데이터셋 | 국립국어원 | 520MB | 국립국어원 사용서약 | 조건부 가능 |
| 모두의 말뭉치: 도서 문장 | 한국어 대화 데이터셋 | 국립국어원 | 850MB | 국립국어원 사용서약 | 조건부 가능 |
| 모두의 말뭉치: 소셜 미디어 | 한국어 대화 데이터셋 | 국립국어원 | 120MB | 국립국어원 사용서약 | 조건부 가능 |
| KoBEST 언어 추론 벤치마크 | 한국어 LLM 벤치마크 | Hugging Face | 5.1MB | CC BY-SA 4.0 | 가능 |
| GSM8K 한국어 번역 수학 데이터셋 | 한국어 번역 데이터셋 | Hugging Face | 4.8MB | MIT | 가능 |
| KoBigBench Lite | 한국어 LLM 벤치마크 | Hugging Face | 12MB | 원본 확인 | 가능 |
| KoGPT2 기본 사전학습 코퍼스 | 한국어 사전학습 코퍼스 | Hugging Face | 3.2GB | 원본 확인 | 가능 |
| 소상공인 1:1 고객상담 데이터 | 한국어 NLP 데이터셋 | AI Hub | 450MB | AI Hub 이용안내 | 조건부 가능 |
| 일반 도서 및 인프라 요약 데이터 | 한국어 요약 데이터셋 | AI Hub | 620MB | AI Hub 이용안내 | 조건부 가능 |
| 공공 행정문서 대상 기계독해 | 한국어 QA 데이터셋 | AI Hub | 180MB | AI Hub 이용안내 | 조건부 가능 |
| 금융 금융보고서 기계독해 데이터 | 한국어 QA 데이터셋 | AI Hub | 140MB | AI Hub 이용안내 | 조건부 가능 |
| 뉴스 기사 요약 및 분류 통합 데이터 | 한국어 요약 데이터셋 | AI Hub | 540MB | AI Hub 이용안내 | 조건부 가능 |
| 특허 명세서 분석 및 자동 Q&A | 한국어 NLP 데이터셋 | AI Hub | 890MB | AI Hub 이용안내 | 조건부 가능 |
| 지역별 한국어 방언 표준어 매치 | 한국어 NLP 데이터셋 | AI Hub | 320MB | AI Hub 이용안내 | 조건부 가능 |
| 판례 및 법률 조문 임베딩 데이터 | 한국어 NLP 데이터셋 | AI Hub | 1.1GB | AI Hub 이용안내 | 조건부 가능 |
| SNS 소셜 대화 정제 데이터셋 | 한국어 대화 데이터셋 | AI Hub | 980MB | AI Hub 이용안내 | 조건부 가능 |
| 전문 학술지 및 도서 요약 데이터 | 한국어 요약 데이터셋 | AI Hub | 750MB | AI Hub 이용안내 | 조건부 가능 |
| 한국어 일반상식 멀티초이스 데이터 | 한국어 QA 데이터셋 | AI Hub | 45MB | AI Hub 이용안내 | 조건부 가능 |
| 공공기관 배포 행정문서 요약본 | 한국어 요약 데이터셋 | AI Hub | 410MB | AI Hub 이용안내 | 조건부 가능 |
| 웹 기반 심층 뉴스 말뭉치 | 한국어 대화 데이터셋 | AI Hub | 2.4GB | AI Hub 이용안내 | 조건부 가능 |
| 한국인 외래어 한영 발음 전사 | 한국어 번역 데이터셋 | AI Hub | 55MB | AI Hub 이용안내 | 조건부 가능 |
| 산업별 전문 도메인 텍스트 말뭉치 | 한국어 대화 데이터셋 | AI Hub | 3.5GB | AI Hub 이용안내 | 조건부 가능 |
| 통합 상담사-고객 대화 분류 및 요약 | 한국어 요약 데이터셋 | AI Hub | 780MB | AI Hub 이용안내 | 조건부 가능 |
| 정신건강 웰니스 챗봇 상담 질의응답 | 한국어 QA 데이터셋 | AI Hub | 8.5MB | AI Hub 이용안내 | 조건부 가능 |
| 대형 마트 및 유통사 고객 서비스 QA | 한국어 QA 데이터셋 | AI Hub | 120MB | AI Hub 이용안내 | 조건부 가능 |
| 생활 법률 및 세무 행정 Q&A 데이터 | 한국어 NLP 데이터셋 | AI Hub | 180MB | AI Hub 이용안내 | 조건부 가능 |
| 공인중개사 부동산 매물 설명 텍스트 | 한국어 NLP 데이터셋 | AI Hub | 340MB | AI Hub 이용안내 | 조건부 가능 |
| 초중고 국어 및 교육용 지문 데이터셋 | 한국어 NLP 데이터셋 | AI Hub | 190MB | AI Hub 이용안내 | 조건부 가능 |
| 병원 임상 의학 가상 진료 차트 텍스트 | 한국어 NLP 데이터셋 | AI Hub | 480MB | AI Hub 이용안내 | 조건부 가능 |
| 드라마 및 방송 연극 시나리오 대본 | 한국어 NLP 데이터셋 | AI Hub | 520MB | AI Hub 이용안내 | 조건부 가능 |
| 이커머스 상품 카피라이팅 광고 텍스트 | 한국어 광고 카피 데이터셋 | AI Hub | 90MB | AI Hub 이용안내 | 조건부 가능 |
| 전기 전자 분야 기술 특허 상세 명세 | 한국어 NLP 데이터셋 | AI Hub | 1.5GB | AI Hub 이용안내 | 조건부 가능 |
| 귀농 농업 기술 및 병해충 자가 상담 | 한국어 NLP 데이터셋 | AI Hub | 110MB | AI Hub 이용안내 | 조건부 가능 |
| 지자체 대표 관광 마케팅 카드뉴스 요약 | 한국어 요약 데이터셋 | AI Hub | 85MB | AI Hub 이용안내 | 조건부 가능 |
| 국산 SUV/세단 자동차 사용자 매뉴얼 QA | 한국어 QA 데이터셋 | AI Hub | 230MB | AI Hub 이용안내 | 조건부 가능 |
| 기업 경제 뉴스 기사 감성 극성 사전 | 한국어 감성분석 데이터셋 | AI Hub | 40MB | AI Hub 이용안내 | 조건부 가능 |
| 중소기업 기술 애로 상담 및 전문가 문답 | 한국어 NLP 데이터셋 | AI Hub | 130MB | AI Hub 이용안내 | 조건부 가능 |
| 조선왕조실록 및 고전 한문 번역 병렬 데이터 | 한국어 번역 데이터셋 | AI Hub | 1.8GB | AI Hub 이용안내 | 조건부 가능 |
| KBS/MBC 시사 토론 및 교양 방송 요약 | 한국어 요약 데이터셋 | AI Hub | 440MB | AI Hub 이용안내 | 조건부 가능 |
| 소셜 인플루언서 가상 멀티턴 메신저 대화 | 한국어 대화 데이터셋 | AI Hub | 310MB | AI Hub 이용안내 | 조건부 가능 |
| 모바일 게임 안내 및 퀘스트 가이드 QA | 한국어 QA 데이터셋 | AI Hub | 85MB | AI Hub 이용안내 | 조건부 가능 |
| KSS Dataset (성우 음성 합성) | 한국어 TTS 데이터셋 | Hugging Face | 12시간+ | CC BY-NC-SA 4.0 | 불가 |
| ClovaCall | 한국어 음성인식 데이터셋 | GitHub | 11,000명 이상 | MIT | 불가 |
| KsponSpeech (대규모 자유발화) | 한국어 자유발화 음성인식 | AI Hub | 1000시간 | AI Hub 이용안내 | 조건부 가능 |
| Speech Emotion Dataset (ko) | 한국어 음성 데이터셋 | GitHub | 3.2GB | 원본 확인 | 가능 |
| 지역별 방언 음성 코퍼스 | 한국어 음성 데이터셋 | AI Hub | 500시간 | AI Hub 이용안내 | 조건부 가능 |
| 소아 및 어린이 구어 음성 인식 | 한국어 음성인식 데이터셋 | AI Hub | 120시간 | AI Hub 이용안내 | 조건부 가능 |
| 실버 세대 장노년층 구어 음성 | 한국어 음성인식 데이터셋 | AI Hub | 150시간 | AI Hub 이용안내 | 조건부 가능 |
| 차량 소음 융합 하이테크 음성 제어 | 한국어 음성 데이터셋 | AI Hub | 200시간 | AI Hub 이용안내 | 조건부 가능 |
| 뉴스 아나운서 및 표준어 낭독 음향 | 한국어 TTS 데이터셋 | AI Hub | 100시간 | AI Hub 이용안내 | 조건부 가능 |
| 스마트 가전 및 사물인터넷 음성 명령 | 한국어 음성 데이터셋 | AI Hub | 80시간 | AI Hub 이용안내 | 조건부 가능 |
| 고객 콜센터 대화 녹취 및 음성 | 한국어 음성 데이터셋 | AI Hub | 800시간 | AI Hub 이용안내 | 조건부 가능 |
| 다중 화자 고품질 TTS 빌더 코퍼스 | 한국어 TTS 데이터셋 | AI Hub | 300시간 | AI Hub 이용안내 | 조건부 가능 |
| 정부 부처 및 국회 토론 회의 록 음성 | 한국어 음성 데이터셋 | AI Hub | 600시간 | AI Hub 이용안내 | 조건부 가능 |
| 도시 생활 소음 및 환경 오디오 분류 | 한국어 음성 데이터셋 | AI Hub | 240GB | AI Hub 이용안내 | 조건부 가능 |
| 대학교 전공 강의 및 프레젠테이션 발화 | 한국어 음성 데이터셋 | AI Hub | 400시간 | AI Hub 이용안내 | 조건부 가능 |
| 오디오북 제작용 문학 성우 목소리 | 한국어 TTS 데이터셋 | AI Hub | 180시간 | AI Hub 이용안내 | 조건부 가능 |
| 한국 수어 카메라 캡처 영상 및 주석 | 한국어 음성 데이터셋 | AI Hub | 4TB | AI Hub 이용안내 | 조건부 가능 |
| 실제 보이스피싱 가해자 범죄 음성 | 한국어 음성 데이터셋 | AI Hub | 50시간 | AI Hub 이용안내 | 조건부 가능 |
| 반려동물 울음소리 및 감정 오디오 | 한국어 음성 데이터셋 | AI Hub | 40GB | AI Hub 이용안내 | 조건부 가능 |
| 호흡기 기침 및 비정상 호흡 사운드 | 한국어 음성 데이터셋 | AI Hub | 15GB | AI Hub 이용안내 | 조건부 가능 |
| 야외 원격 조종 드론 프로펠러 소음 | 한국어 음성 데이터셋 | AI Hub | 30GB | AI Hub 이용안내 | 조건부 가능 |
| 전통 악기 연주 및 음정 오디오셋 | 한국어 음성 데이터셋 | AI Hub | 85GB | AI Hub 이용안내 | 조건부 가능 |
| 공장 모터 고장 진단 진동 및 음향 | 한국어 음성 데이터셋 | AI Hub | 120GB | AI Hub 이용안내 | 조건부 가능 |
| 속삭이는 저조도 비밀 소형 음성 인식 | 한국어 음성 데이터셋 | AI Hub | 60시간 | AI Hub 이용안내 | 조건부 가능 |
| 한국 보컬 가창 음원 및 분리 코퍼스 | 한국어 음성 데이터셋 | AI Hub | 150GB | AI Hub 이용안내 | 조건부 가능 |
| 심장 소리 및 폐부 미세 음향 청진 기록 | 한국어 음성 데이터셋 | AI Hub | 8GB | AI Hub 이용안내 | 조건부 가능 |
| 스마트 음성 비서 전용 하이브리드 TTS | 한국어 TTS 데이터셋 | AI Hub | 90시간 | AI Hub 이용안내 | 조건부 가능 |
| 스포츠 중계 리얼 캐스터 흥분 구어 | 한국어 음성 데이터셋 | AI Hub | 220시간 | AI Hub 이용안내 | 조건부 가능 |
| 한국인 고유 영어 발음 및 평가 음성 | 한국어 음성 데이터셋 | AI Hub | 140시간 | AI Hub 이용안내 | 조건부 가능 |
| COYO-700M (카카오브레인) | 한국어 비전 데이터셋 | Hugging Face | 대용량 (7억 쌍) | CC BY 4.0 | 가능 |
| skt/KVQA (시각장애 보조) | 한국어 비전 데이터셋 | Hugging Face | 100,445개 페어 | Korean VQA License | 불가 |
| KRETA (Korean Rich Text Visual QA) | 한국어 OCR 데이터셋 | Hugging Face | 125MB | 원본 확인 | 가능 |
| Korean Tourist Spot Dataset (풍경 이미지) | 한국어 비전 데이터셋 | GitHub | 8.4GB | 원본 확인 | 가능 |
| Korean-Light-OCR (야외 간판 및 표지판) | 한국어 OCR 데이터셋 | GitHub | 4.2GB | 원본 확인 | 가능 |
| Korean Receipts (금융 영수증 OCR) | 영수증 OCR 데이터셋 | Hugging Face | 95MB | CC BY 4.0 | 가능 |
| Table-VQA-ko (스캔문서 표 판독) | 한국어 OCR 데이터셋 | Hugging Face | 185MB | Apache 2.0 | 가능 |
| 도시 로드 야외 주행 전경 및 3D 바운딩 | 한국어 비전 데이터셋 | AI Hub | 12TB | AI Hub 이용안내 | 조건부 가능 |
| K-패션 의류 및 코디 메타데이터 | 한국어 비전 데이터셋 | AI Hub | 850GB | AI Hub 이용안내 | 조건부 가능 |
| 한국인 안면 특징 및 미세 표정 변화 | 한국어 비전 데이터셋 | AI Hub | 2.4TB | AI Hub 이용안내 | 조건부 가능 |
| 한국 거리 전경 고정밀 OCR 자료 | 한국어 OCR 데이터셋 | AI Hub | 1.5TB | AI Hub 이용안내 | 조건부 가능 |
| 한식 단품 요리 및 반찬 다각도 이미지 | 한국어 비전 데이터셋 | AI Hub | 420GB | AI Hub 이용안내 | 조건부 가능 |
| 반려동물 피부 및 안구 안과 질환 식별 | 한국어 비전 데이터셋 | AI Hub | 380GB | AI Hub 이용안내 | 조건부 가능 |
| 사과/배/배추 주요 원예 노지 병해충 | 한국어 비전 데이터셋 | AI Hub | 190GB | AI Hub 이용안내 | 조건부 가능 |
| CCTV 지하철 통로 주취 폭행 및 배회 | 한국어 비전 데이터셋 | AI Hub | 5TB | AI Hub 이용안내 | 조건부 가능 |
| 유리병, 페트병 등 쓰레기 고속 분류 OCR | 한국어 OCR 데이터셋 | AI Hub | 290GB | AI Hub 이용안내 | 조건부 가능 |
| 유네스코 전통 탑 및 궁궐 전경 3D 매시 | 한국어 비전 데이터셋 | AI Hub | 8TB | AI Hub 이용안내 | 조건부 가능 |
| 한국인 다양한 연령대 자필 손글씨 폰트 | 한국어 OCR 데이터셋 | AI Hub | 140GB | AI Hub 이용안내 | 조건부 가능 |
| 노후 콘크리트 및 철골 다리 균열 결함 | 한국어 비전 데이터셋 | AI Hub | 640GB | AI Hub 이용안내 | 조건부 가능 |
| 대형 지하 주차장 코너 장애물 및 차량 바퀴 | 한국어 비전 데이터셋 | AI Hub | 910GB | AI Hub 이용안내 | 조건부 가능 |
| 국내 인기 웹툰 캐릭터 다채 색선화 페이스 | 한국어 비전 데이터셋 | AI Hub | 430GB | AI Hub 이용안내 | 조건부 가능 |
| 강원 영동 건조기 산림 화재 및 연기 | 한국어 비전 데이터셋 | AI Hub | 150GB | AI Hub 이용안내 | 조건부 가능 |
| 해양 한반도 연안 수중 플라스틱 폐기물 | 한국어 비전 데이터셋 | AI Hub | 210GB | AI Hub 이용안내 | 조건부 가능 |
| 건설 철골 토목 공사 현장 인부 보호구 착용 | 한국어 비전 데이터셋 | AI Hub | 1.2TB | AI Hub 이용안내 | 조건부 가능 |
| 국내 실제 아파트 평형별 가구 배치 인테리어 | 한국어 비전 데이터셋 | AI Hub | 750GB | AI Hub 이용안내 | 조건부 가능 |
| 전국 주요 랜드마크 및 고궁 문화 경관 | 한국어 비전 데이터셋 | AI Hub | 1.1TB | AI Hub 이용안내 | 조건부 가능 |
| 여성 자궁경부 암 조기 선별 정밀 현미경 이미지 | 한국어 비전 데이터셋 | AI Hub | 1.6TB | AI Hub 이용안내 | 조건부 가능 |
| 피부과 탈모 및 여드름 아토피 접사 | 한국어 비전 데이터셋 | AI Hub | 320GB | AI Hub 이용안내 | 조건부 가능 |
| 물류창고 컨베이어 박스 바코드 및 문구 | 한국어 비전 데이터셋 | AI Hub | 480GB | AI Hub 이용안내 | 조건부 가능 |
| 서해안/남해안 해안 폐스티로폼 드론 | 한국어 비전 데이터셋 | AI Hub | 520GB | AI Hub 이용안내 | 조건부 가능 |
| PAWS-X (ko) (문장 유사성 분류) | 한국어 NLP 데이터셋 | GitHub | 5.1MB | Other | 조건부 가능 |
| TyDi-QA (ko) (구글 다국어 질의응답) | 한국어 QA 데이터셋 | GitHub | 18.5MB | Apache 2.0 | 가능 |
| Open Subtitles (ko-en) (자막 번역) | 한국어 번역 데이터셋 | GitHub | 대용량 | 원본 확인 | 가능 |
| Tatoeba (ko-en) | 한국어 번역 데이터셋 | GitHub | 3.4MB | CC BY 2.0 | 가능 |
| TinyStories 한국어 번역 데이터셋 | 한국어 번역 데이터셋 | Hugging Face | 대용량 | MIT | 가능 |
| KoInFoBench 한국어 지시어 이행 평가 데이터셋 | 한국어 지시문 학습 데이터셋 | Hugging Face | 소용량 | MIT | 가능 |
| 한국어 사전학습 위키 코퍼스 | 한국어 사전학습 코퍼스 | Hugging Face | 중용량 | MIT | 가능 |
| 오픈 한국어 인스트럭션 데이터셋 | 한국어 지시문 학습 데이터셋 | Hugging Face | 대용량 | MIT | 가능 |
| 청와대 국민청원 데이터셋 | 한국어 NLP 데이터셋 | Hugging Face | 대용량 | MIT | 가능 |
| QARV 한국어 인스트럭션 데이터셋 | 한국어 지시문 학습 데이터셋 | Hugging Face | 중용량 | MIT | 가능 |
| Orca 한국어 DPO 선호도 데이터셋 | 한국어 NLP 데이터셋 | Hugging Face | 중용량 | Apache 2.0 | 가능 |
| KOpen 고품질 에르메스 한국어 데이터셋 | 한국어 번역 데이터셋 | Hugging Face | 중용량 | MIT | 가능 |
| 한국어 상업용 지시어 데이터셋 | 한국어 지시문 학습 데이터셋 | Hugging Face | 대용량 | MIT | 가능 |
| 캐럿AI 한국어 지시어 데이터셋 | 한국어 지시문 학습 데이터셋 | Hugging Face | 소용량 | Apache 2.0 | 가능 |
| 한국어 다단계 논리 추론 데이터셋 | 한국어 QA 데이터셋 | Hugging Face | 소용량 | Apache 2.0 | 가능 |
| 한국어 금융 특화 지시어 데이터셋 | 한국어 지시문 학습 데이터셋 | Hugging Face | 중용량 | MIT | 가능 |
| 한국어 일상 구어체 대화 데이터셋 | 한국어 대화 데이터셋 | Hugging Face | 대용량 | Apache 2.0 | 가능 |
| 송영숙 한국어 챗봇 문답 데이터셋 | 한국어 감성분석 데이터셋 | GitHub | 소용량 | MIT | 가능 |
| 한국어 온라인 댓글 욕설 탐지 데이터셋 | 한국어 유해성 데이터셋 | GitHub | 소용량 | MIT | 가능 |
| 한국어 인공 교과서 코퍼스 데이터셋 | 한국어 사전학습 코퍼스 | Hugging Face | 대용량 | Apache 2.0 | 가능 |
| SQuARe 한국어 민감 주제 안전성 데이터셋 | 한국어 NLP 데이터셋 | GitHub | 중용량 | MIT | 가능 |
| KoSBi 한국어 편향성 완화 데이터셋 | 한국어 NLP 데이터셋 | GitHub | 대용량 | MIT | 가능 |
| 카카오엔터프라이즈 한국어 멀티턴 적대적 대화 데이터셋 | 한국어 지시문 학습 데이터셋 | GitHub | 소용량 | Apache 2.0 | 가능 |
| 한국어 수학 문장형 문제 풀이 데이터셋 | 한국어 NLP 데이터셋 | GitHub | 소용량 | MIT | 가능 |
| HateScore 한국어 다중 차원 혐오 감지 데이터셋 | 한국어 유해성 데이터셋 | GitHub | 중용량 | Apache 2.0 | 가능 |
| LIMA 한국어 고품질 극소정예 데이터셋 | 한국어 지시문 학습 데이터셋 | Hugging Face | 소용량 | CC BY-NC-SA 4.0 | 가능 |
| Zeroth 한국어 음성 인식 오픈소스 데이터셋 | 한국어 음성인식 데이터셋 | GitHub | 대용량 | Apache 2.0 | 가능 |
| MeloTTS 한국어 실시간 음성합성 데이터셋 | 한국어 TTS 데이터셋 | Hugging Face | 중용량 | MIT | 가능 |
| 한국 문화 맥락 이해 벤치마크 데이터셋 | 한국어 LLM 벤치마크 | Hugging Face (SOGANG-ISDS) | 소용량 | Apache 2.0 | 가능 |
| 한국어 교육용 필터링 웹텍스트 데이터셋 | 한국어 사전학습 코퍼스 | Hugging Face (devngho) | 대용량 | MIT | 가능 |
| 엘리스 한국어 FineWeb-Edu 데모 데이터셋 | 한국어 사전학습 코퍼스 | Hugging Face (eliceai) | 중용량 | Apache 2.0 | 가능 |
| SNU Ko-MuSR 한국어 다단계 추론 데이터셋 | 한국어 LLM 벤치마크 | Hugging Face (thunder-research-group) | 소용량 | MIT | 가능 |
| 교과서 기반 에듀케이션 한국어 말뭉치 | 한국어 지시문 학습 데이터셋 | Hugging Face (devngho) | 대용량 | MIT | 가능 |
| 한국어 이미지 정밀 묘사 데이터셋 | 한국어 비전 데이터셋 | Hugging Face (Nagase-Kotono) | 대용량 (7.85 GB) | Apache 2.0 | 가능 |
| 다양한 문체 변환 한국어 인스트럭션 | 한국어 지시문 학습 데이터셋 | Hugging Face (coastral) | 중용량 | Apache 2.0 | 가능 |
| 한국어 Function Calling 도구 사용 데이터셋 | 한국어 지시문 학습 데이터셋 | Hugging Face (gyung) | 소용량 | Apache 2.0 | 가능 |
| KOTE 한국어 온라인 댓글 감정 데이터셋 | 한국어 감성분석 데이터셋 | Hugging Face (searle-j) | 중용량 | MIT | 가능 |
| 네이버 영화 리뷰 감성 코퍼스 (NSMC) | 한국어 감성분석 데이터셋 | GitHub (e9t) | 소용량 | CC BY 2.0 | 가능 |
| 한국어 질의응답 데이터셋 1.0 (KorQuAD) | 한국어 QA 데이터셋 | KorQuAD 공식 | 중용량 | CC BY-ND 4.0 | 가능 |
| KLUE 연합뉴스 기사 제목 분류 데이터셋 | 한국어 NLP 데이터셋 | Hugging Face (KLUE) | 소용량 | CC BY-SA 4.0 | 가능 |
| KLUE 한국어 자연어 추론 데이터셋 | 한국어 NLP 데이터셋 | Hugging Face (KLUE) | 소용량 | CC BY-SA 4.0 | 가능 |
| KLUE 한국어 유사도 측정 데이터셋 | 한국어 LLM 벤치마크 | Hugging Face (KLUE) | 소용량 | CC BY-SA 4.0 | 가능 |
| KLUE 한국어 개체명 인식 데이터셋 | 한국어 개체명 데이터셋 | Hugging Face (KLUE) | 중용량 | CC BY-SA 4.0 | 가능 |
| KLUE 한국어 관계 추출 데이터셋 | 한국어 NLP 데이터셋 | Hugging Face (KLUE) | 소용량 | CC BY-SA 4.0 | 가능 |
| KLUE 한국어 기계독해 벤치마크 | 한국어 QA 데이터셋 | Hugging Face (KLUE) | 중용량 | CC BY-SA 4.0 | 가능 |
| 스마일게이트 Smilegate UnSmile 데이터셋 | 한국어 NLP 데이터셋 | GitHub | 소용량 | CC BY-NC-ND 4.0 | 조건부 가능 |
| 한국어 대규모 기계독해 데이터셋 2.0 (KorQuAD) | 한국어 QA 데이터셋 | KorQuAD 공식 | 대용량 (표 포함) | CC BY-ND 4.0 | 가능 |
| 한국어 위키백과 정제 말뭉치 | 한국어 대화 데이터셋 | GitHub | 중용량 | CC BY-SA 4.0 | 가능 |
| 한국어 속담 및 관용구 해석 데이터셋 | 한국어 NLP 데이터셋 | GitHub | 소용량 | MIT | 가능 |
| KoBEST 언어추론 벤치마크 (COPA) | 한국어 LLM 벤치마크 | Hugging Face (SKT-brain) | 소용량 | CC BY-SA 4.0 | 가능 |
| KoBEST 상황 지속성 추론 (HellaSwag) | 한국어 LLM 벤치마크 | Hugging Face (SKT-brain) | 소용량 | CC BY-SA 4.0 | 가능 |
| 실생활 한국어 비유 표현 수집 코퍼스 | 한국어 사전학습 코퍼스 | Hugging Face | 소용량 | MIT | 가능 |
| 네이버 쇼핑 상품 리뷰 감성 분석 데이터셋 | 한국어 감성분석 데이터셋 | GitHub (bab2min) | 소용량 | CC BY-SA 4.0 | 가능 |
| 스팀 한국어 게임 리뷰 감성 코퍼스 | 한국어 감성분석 데이터셋 | GitHub (bab2min) | 소용량 | CC BY-SA 4.0 | 가능 |
| 카카오브레인 KorNLI 자연어 추론 데이터셋 | 한국어 NLP 데이터셋 | GitHub (kakaobrain) | 대용량 | CC BY-SA 4.0 | 가능 |
| 카카오브레인 KorSTS 문장 유사도 데이터셋 | 한국어 NLP 데이터셋 | GitHub (kakaobrain) | 소용량 | CC BY-SA 4.0 | 가능 |
| KoBEST 단단문 참거짓 판정 (BoolQ) | 한국어 QA 데이터셋 | Hugging Face (SKT-brain) | 소용량 | CC BY-SA 4.0 | 가능 |
| KoBEST 문맥상 어휘 다의어 추론 (WiC) | 한국어 NLP 데이터셋 | Hugging Face (SKT-brain) | 소용량 | CC BY-SA 4.0 | 가능 |
| 한국어 오탈자 및 띄어쓰기 문장 교정 코퍼스 | 한국어 사전학습 코퍼스 | GitHub | 중용량 | MIT | 가능 |
| 한국어 질문 자동 생성(QG) 데이터셋 | 한국어 지시문 학습 데이터셋 | Hugging Face | 소용량 | Apache 2.0 | 가능 |
| 한국어 속담 빈칸 완성 데이터셋 | 한국어 LLM 벤치마크 | GitHub | 소용량 | MIT | 가능 |
| KMMLU-Pro 전문 지식 평가 데이터셋 | 한국어 LLM 벤치마크 | Hugging Face (LGAI-EXAONE) | 12MB | CC BY-NC 4.0 | 가능 |
| 서울대 Thunder-KoNUBench 한국어 부정문 이해 데이터셋 | 한국어 LLM 벤치마크 | Hugging Face (thunder-research-group) | 5.4MB | CC BY-NC-SA 4.0 | 가능 |
| KoSum 한국어 유튜브 멀티모달 요약 데이터셋 | 한국어 음성 데이터셋 | Hugging Face (iontail) | 45GB | CC BY-NC 4.0 | 가능 |
| K-BrowseComp 한국어 웹 브라우징 에이전트 벤치마크 | 한국어 LLM 벤치마크 | Hugging Face (prometheus-eval) | 3.5MB | MIT | 가능 |
| WanJuanSiLu 한국어 고품질 웹 텍스트 코퍼스 | 한국어 대화 데이터셋 | Hugging Face (opendatalab) | 124 GB | CC BY 4.0 | 가능 |
| KREW 한국어 페르소나 역할극(Role-Playing) 데이터셋 | 한국어 지시문 학습 데이터셋 | Hugging Face (huggingface-KREW) | 28MB | Apache 2.0 | 가능 |
| 서울대 Ko-WinoGrande 한국어 대명사 지시 추론 데이터셋 | 한국어 지시문 학습 데이터셋 | Hugging Face (thunder-research-group) | 4.2MB | CC BY 4.0 | 가능 |
| SmileStyle 한국어 다채로운 문체 변환 코퍼스 | 한국어 사전학습 코퍼스 | GitHub (smilegate-ai) | 35MB | MIT | 가능 |
| KoIn 한국 인플루언서 인물 인식 이미지 데이터셋 | 한국어 비전 데이터셋 | GitHub (dukong1) | 140 GB | MIT | 가능 |
| ToM-Diary 한국어 마음이해(Theory of Mind) 데이터셋 | 한국어 NLP 데이터셋 | GitHub | 8.5MB | Apache 2.0 | 가능 |
| KoCoSa 한국어 세부적 상식 추론 지시 데이터셋 | 한국어 지시문 학습 데이터셋 | GitHub | 18MB | Apache 2.0 | 가능 |
| KPoEM 한국어 고전 시 문학 정서 주석 데이터셋 | 한국어 감성분석 데이터셋 | GitHub | 4.2MB | MIT | 가능 |
| KMRE 한국어 임상의학 논문 관계 추출 데이터셋 | 한국어 NLP 데이터셋 | GitHub | 15MB | Apache 2.0 | 가능 |
| KoSEnd 한국어 어휘론적 함의(Entailment) 데이터셋 | 한국어 NLP 데이터셋 | GitHub | 6.2MB | Apache 2.0 | 가능 |
| Korean SAT Math 수능 수학 논리 추론 데이터셋 | 한국어 NLP 데이터셋 | Hugging Face (Quadyun) | 8.5MB | MIT | 가능 |
| KoelLabs 다국어 화자 한국어 악센트 음성 데이터셋 | 한국어 음성인식 데이터셋 | Hugging Face (KoelLabs) | 18 GB | CC BY-NC 4.0 | 가능 |
| CSAT-KOREAN-2025 대학수학능력시험 국어 데이터셋 | 한국어 QA 데이터셋 | Hugging Face (KKACHI-HUB) | 3.2MB | MIT | 가능 |
| 한국 선거 여론 및 미디어 오피니언 분석 데이터셋 | 한국어 NLP 데이터셋 | Hugging Face (AFOS-Analytics1) | 45MB | CC BY 4.0 | 가능 |
| 엔비디아 Nemotron 한국어 가상 페르소나 데이터셋 | 한국어 NLP 데이터셋 | Hugging Face (nvidia) | 120MB | CC BY 4.0 | 조건부 가능 |
| 수능 영어 지문 한글 초고밀 번역 데이터셋 | 한국어 번역 데이터셋 | Hugging Face (cfpark00) | 5.5MB | CC BY-NC-SA 4.0 | 가능 |
| 한문 한자-한글 대칭 수동 번역 데이터셋 | 한국어 번역 데이터셋 | GitHub | 중용량 | CC0 | 가능 |
| 한국어 일반 의학 및 자가 진단 상담 데이터셋 | 한국어 NLP 데이터셋 | Hugging Face | 중용량 | Apache 2.0 | 가능 |
| 한국어 생활 법률 민원 지식 데이터셋 | 한국어 NLP 데이터셋 | Hugging Face | 중용량 | Apache 2.0 | 가능 |
| 한국어 자소-음소 변환 소리 정렬 데이터셋 | 한국어 NLP 데이터셋 | GitHub | 소용량 | MIT | 가능 |
| 네이버 NLP 챌린지 한국어 개체명 인식 데이터 | 한국어 개체명 데이터셋 | GitHub (Naver-NLP) | 중용량 | CC0 | 가능 |
| 한국어 소형 IoT 스마트홈 제어 음성 데이터 | 한국어 음성 데이터셋 | GitHub | 중용량 | Apache 2.0 | 가능 |
| 한국 전통 요리법 및 조리 순서 데이터셋 | 한국어 NLP 데이터셋 | GitHub | 소용량 | MIT | 가능 |
| 한국 방언 및 팔도 사투리 전사 메타데이터 | 한국어 음성 데이터셋 | AI Hub / GitHub | 대용량 | Apache 2.0 | 가능 |
| 한국어 주요 일간지 뉴스 생성형 요약 코퍼스 | 한국어 요약 데이터셋 | Hugging Face / AI Hub | 대용량 | Apache 2.0 | 가능 |
| 쇼핑 리뷰 어스펙트 기반 감정 분석 데이터 | 한국어 감성분석 데이터셋 | Hugging Face | 소용량 | MIT | 가능 |
| 한국어 단문 및 장문 SMS 스팸 분류 데이터셋 | 한국어 NLP 데이터셋 | GitHub | 소용량 | MIT | 가능 |
| 한국어 의문사 기반 질문 분류 데이터셋 | 한국어 NLP 데이터셋 | GitHub | 소용량 | MIT | 가능 |
| 한국인 생활 상식 및 논리적 연쇄 추론 데이터 | 한국어 LLM 벤치마크 | Hugging Face / GitHub | 중용량 | Apache 2.0 | 가능 |
| 한국 특허 정보 다국어 번역 병렬 데이터 | 한국어 번역 데이터셋 | GitHub / AI Hub | 대용량 | Apache 2.0 | 가능 |
| KoELECTRA 보캡 최적화 원시 텍스트 말뭉치 | 한국어 대화 데이터셋 | GitHub (monologg) | 대용량 (34GB) | Apache 2.0 | 가능 |
| 한국 근현대 시 문학 말뭉치 | 한국어 대화 데이터셋 | GitHub | 소용량 | MIT | 가능 |
| 한국어 반어법 및 비꼼 감정 분류 데이터셋 | 한국어 감성분석 데이터셋 | GitHub | 소용량 | MIT | 가능 |
| 한국어 금융 뉴스 감성 분석 데이터셋 | 한국어 감성분석 데이터셋 | GitHub | 소용량 | Apache 2.0 | 가능 |
| 한국어 말투 및 종결어미 스타일 변환 데이터셋 | 한국어 NLP 데이터셋 | GitHub | 중용량 | MIT | 가능 |
| 한국어 일상 스몰토크 치챗 코퍼스 | 한국어 감성분석 데이터셋 | GitHub | 중용량 | MIT | 가능 |
| 소셜 미디어 한국어 악성 텍스트 필터링 데이터 | 한국어 NLP 데이터셋 | GitHub | 중용량 | Apache 2.0 | 가능 |
| 한국어 위키피디아 기반 상식 질의응답 데이터셋 | 한국어 QA 데이터셋 | Hugging Face | 중용량 | MIT | 가능 |
| 한국어 문법성 판단 및 비문 교정 데이터셋 | 한국어 문법 평가 벤치마크 | GitHub | 소용량 | MIT | 가능 |
| 한국어 신조어 및 인터넷 밈(Meme) 해설 사전 데이터 | 한국어 NLP 데이터셋 | GitHub | 소용량 | MIT | 가능 |
| 한국어 7대 감정 음성 전사 데이터셋 | 한국어 TTS 데이터셋 | AI Hub / GitHub | 대용량 | Apache 2.0 | 가능 |
| 한국어 상식 추론 객관식 평가 벤치마크 | 한국어 LLM 벤치마크 | Hugging Face | 소용량 | Apache 2.0 | 가능 |
| 한국어 위키 개요 자동 요약 데이터셋 | 한국어 요약 데이터셋 | Hugging Face | 중용량 | CC BY-SA 4.0 | 가능 |
| 한국어 숙어 및 다어휘식 영어 번역 병렬 데이터셋 | 한국어 번역 데이터셋 | GitHub | 소용량 | MIT | 가능 |
| Ko-Llama 다각적 지시어 미세조정 데이터셋 | 한국어 지시문 학습 데이터셋 | Hugging Face | 대용량 | Apache 2.0 | 가능 |
| 한국어 이커머스 쇼핑몰 고객 의도 분류 데이터 | 한국어 NLP 데이터셋 | GitHub | 소용량 | MIT | 가능 |
| 한국어 의미상 동치 문장 판별 데이터셋 | 한국어 NLP 데이터셋 | Hugging Face | 중용량 | Apache 2.0 | 가능 |
| 한국어 금표준(Gold Standard) 개체명 인식 데이터 | 한국어 개체명 데이터셋 | GitHub | 소용량 | MIT | 가능 |
| 한국인 단어 연상 의미망 코퍼스 | 한국어 사전학습 코퍼스 | GitHub | 소용량 | MIT | 가능 |
| 한국어 전문 한자 용어 쉬운 말 풀이 코퍼스 | 한국어 사전학습 코퍼스 | Hugging Face | 소용량 | Apache 2.0 | 가능 |
| 한국어 사설 및 논설 아규먼트 마이닝 데이터셋 | 한국어 NLP 데이터셋 | GitHub | 소용량 | MIT | 가능 |
| 한국어 요식업 배달 앱 리뷰 감성 분류 데이터셋 | 한국어 감성분석 데이터셋 | GitHub | 중용량 | MIT | 가능 |
| 한국어 기초 간호 기록지 익명 명세 코퍼스 | 한국어 사전학습 코퍼스 | GitHub | 중용량 | Apache 2.0 | 가능 |
| 한국어 은유 및 시적 비유 감지 데이터셋 | 한국어 NLP 데이터셋 | GitHub | 소용량 | MIT | 가능 |
| 한국어 AI 모델 불법 및 탈옥 거부 응답 데이터셋 | 한국어 NLP 데이터셋 | Hugging Face | 소용량 | Apache 2.0 | 가능 |
| 다문화 실생활 한-베트남어 병렬 코퍼스 | 한국어 번역 데이터셋 | AI Hub | 140MB | AI Hub 이용안내 | 조건부 가능 |
| 한-중 무역 계약서 및 공식 비즈니스 번역 | 한국어 번역 데이터셋 | AI Hub | 320MB | AI Hub 이용안내 | 조건부 가능 |
| 한-일 관광 가이드 및 지하철 노선 안내 번역 | 한국어 번역 데이터셋 | AI Hub | 120MB | AI Hub 이용안내 | 조건부 가능 |
| 한-영 IT 시스템 엔지니어링 기술 설명서 번역 | 한국어 번역 데이터셋 | AI Hub | 410MB | AI Hub 이용안내 | 조건부 가능 |
| 주요 영자 신문 및 연합뉴스 한영 병렬 뉴스 | 한국어 번역 데이터셋 | AI Hub | 620MB | AI Hub 이용안내 | 조건부 가능 |
| K-POP 노래 가사 다국어 번역 및 한글 로마자 | 한국어 번역 데이터셋 | GitHub | 2.5MB | 원본 확인 | 가능 |
| 유튜브 브이로그 구어체 자막 한영 다각 번역 | 한국어 번역 데이터셋 | GitHub | 18MB | 원본 확인 | 가능 |
| 국제 특허 출원용 첨단 기계 기술 한영/한중 | 한국어 번역 데이터셋 | AI Hub | 2.2GB | AI Hub 이용안내 | 조건부 가능 |
| 의약품 복약 설명서 및 글로벌 임상 가이드 | 한국어 번역 데이터셋 | AI Hub | 180MB | AI Hub 이용안내 | 조건부 가능 |
| 영문 정관 및 대외 투자 지분 인수 계약서 | 한국어 번역 데이터셋 | AI Hub | 240MB | AI Hub 이용안내 | 조건부 가능 |
| Ko-Agent-Trajectories-1.0 | 한국어 NLP 데이터셋 | Hugging Face | 대용량 | Apache 2.0 | 가능 |
| KoGEM — 한국어 문법 평가 벤치마크 | 한국어 문법 평가 벤치마크 | Hugging Face | 1.2MB | MIT | 가능 |
| KIT-19 — 한국어 인스트럭션 19개 태스크 | 한국어 지시문 학습 데이터셋 | Hugging Face | 85MB | CC BY 4.0 | 가능 |
| Ko-MMLU-Pro | 한국어 LLM 벤치마크 | Hugging Face | 45MB | MIT | 가능 |
| 한국어 수학 추론 데이터셋 | 한국어 NLP 데이터셋 | Hugging Face | 120MB | 원본 확인 | 가능 |
| 한국어 안전성 벤치마크 (KoSafetyBench) | 한국어 LLM 벤치마크 | Hugging Face | 15MB | CC BY 4.0 | 가능 |
| Ko-ARC Challenge | 한국어 LLM 벤치마크 | Hugging Face | 8MB | CC BY-SA 4.0 | 가능 |
| Korean Open-ORPO SFT+DPO | 한국어 지시문 학습 데이터셋 | Hugging Face | 65MB | Apache 2.0 | 가능 |
| HAE-RAE Bench 1.1 | 한국어 LLM 벤치마크 | Hugging Face | 2.9MB | CC BY-NC-ND 4.0 | 조건부 가능 |
| HAE-RAE Bench 2.0 | 한국어 LLM 벤치마크 | Hugging Face | 1.0MB | MIT | 가능 |
| KoCommonGEN v2 | 한국어 LLM 벤치마크 | Hugging Face | 183KB | 원본 확인 | 조건부 가능 |
| APEACH 한국어 혐오 표현 평가셋 | 한국어 LLM 벤치마크 | Hugging Face | 1.1MB | CC BY-SA 4.0 | 가능 |
| HRM8K (HAE-RAE Math 8K) | 한국어 LLM 벤치마크 | Hugging Face | 4.9MB | MIT | 가능 |
| K-MHaS 다중 라벨 혐오 발화 | 한국어 유해성 데이터셋 | Hugging Face | 9.1MB | CC BY-SA 4.0 | 가능 |
| K-HATERS 대상별 공격성 코퍼스 | 한국어 유해성 데이터셋 | Hugging Face | 50.5MB | CC BY 4.0 | 가능 |
| KorNAT 한국 상식·사회가치 QA | 한국어 QA 데이터셋 | Hugging Face | 2.6MB | CC BY-NC 4.0 | 조건부 가능 |
| KoAlpaca v1.0 (번역 Alpaca) | 한국어 지시문 학습 데이터셋 | Hugging Face | 8.1MB | CC BY-NC 4.0 | 조건부 가능 |
| KOpen-Platypus | 한국어 지시문 학습 데이터셋 | Hugging Face | 15.9MB | CC BY 4.0 | 가능 |
| OpenAssistant Guanaco 한국어 | 한국어 지시문 학습 데이터셋 | Hugging Face | 16.7MB | Apache 2.0 | 가능 |
| HRMCR 다단계 한국 상식 추론 | 한국어 LLM 벤치마크 | Hugging Face | 106KB | Apache 2.0 | 가능 |
| KoBBQ 한국어 사회 편향 QA | 한국어 QA 데이터셋 | Hugging Face | 2.4MB | MIT | 가능 |
| KorMedMCQA 보건의료 국가시험 QA | 한국어 QA 데이터셋 | Hugging Face | 2.1MB | CC BY-NC 4.0 | 조건부 가능 |
| KoBALT-700 한국어 언어학 벤치마크 | 한국어 LLM 벤치마크 | Hugging Face | 644KB | CC BY-NC 4.0 | 조건부 가능 |
| KoSimpleQA 한국어 사실성 QA | 한국어 QA 데이터셋 | Hugging Face | 301KB | 원본 확인 | 조건부 가능 |
| Ko-PIQA 한국어 물리 상식 | 한국어 QA 데이터셋 | Hugging Face | 204KB | 원본 확인 | 조건부 가능 |
| K-MMBench 한국어 비전-언어 벤치마크 | 한국어 비전 데이터셋 | Hugging Face | 92.4MB | CC BY-NC 4.0 | 조건부 가능 |
| K²-Eval 한국 문화 지시 평가 | 한국어 지시문 학습 데이터셋 | Hugging Face | 178KB | MIT | 가능 |
| KcBERT 사전학습 댓글 코퍼스 | 한국어 사전학습 코퍼스 | Hugging Face | 7.90 GiB | CC BY-SA 4.0 | 가능 |
| 네이버 뉴스 한국어 요약 | 한국어 요약 데이터셋 | Hugging Face | 44.4MB | Apache 2.0 | 가능 |
| OpenOrca-KO | 한국어 지시문 학습 데이터셋 | Hugging Face | 21.8MB | MIT | 가능 |
| HAE-RAE CoT 1.5M | 한국어 NLP 데이터셋 | Hugging Face | 1.05GB | CC BY 4.0 | 가능 |
| KBMC 한국어 바이오메디컬 NER | 한국어 개체명 데이터셋 | Hugging Face | 1.4MB | Apache 2.0 | 가능 |
| KOLD 한국어 공격 발화 | 한국어 유해성 데이터셋 | GitHub | 40,429 댓글 | 원본 확인 | 조건부 가능 |
| KorWikiTableQuestions | 한국어 QA 데이터셋 | GitHub | 70K 표 QA | CC BY-SA 4.0 | 가능 |
| KoDialogBench 대화 이해 벤치마크 | 한국어 LLM 벤치마크 | Hugging Face | 82,962 예제, 21개 테스트셋 | CC BY-NC-SA 4.0 | 조건부 가능 |
| FunctionChat-Bench 한국어 도구 호출 | 한국어 LLM 벤치마크 | GitHub | 500 단일턴 + 45 멀티턴 | Apache 2.0 | 가능 |
| Jejueo JIT/JSS 제주어 병렬·음성 | 한국어 번역 데이터셋 | GitHub | 170K+ 병렬 문장, 10K 음성 | Apache 2.0 | 가능 |
| ParaKQC 한국어 질문·명령 병렬 | 한국어 NLP 데이터셋 | GitHub | 10,000 발화 (v1) | CC BY-SA 4.0 | 가능 |
| Pansori TEDxKR 음성 코퍼스 | 한국어 음성인식 데이터셋 | GitHub | 약 3시간 | CC BY-NC-ND 4.0 | 조건부 가능 |
| KBL 한국어 법률 이해 벤치마크 | 한국어 QA 데이터셋 | Hugging Face | 8.1MB | CC BY-NC 4.0 | 조건부 가능 |
| OLKAVS 한국어 시청각 음성 | 한국어 음성인식 데이터셋 | GitHub | 1,150시간 오디오 | 원본 확인 | 조건부 가능 |
| 한국어 위키백과 교육용 필터 코퍼스 | 한국어 사전학습 코퍼스 | Hugging Face | 764MB | CC BY-SA 4.0 | 조건부 가능 |
| xP3x 한국어 프롬프트 서브셋 | 한국어 지시문 학습 데이터셋 | Hugging Face | 한글 4,642,468행 | Apache 2.0 | 조건부 가능 |