카탈로그
한국어 AI 데이터셋 이름순 목록
286개 중 161–200 · 5 / 8쪽
홈에 카탈로그 전체를 넣지 않기 위해, 같은 목록을 짧은 HTML 페이지로 나눈 보기입니다. 라이선스와 용량은 저장된 표기입니다. 음성·OCR·지시문·감성은 모음 페이지에 있습니다. 기어델은 파일을 보관하지 않습니다.
| 이름 | 용도 | 제공처 | 크기 | 라이선스 | 상업이용 |
|---|---|---|---|---|---|
| 한국어 주요 일간지 뉴스 생성형 요약 코퍼스 | 한국어 요약 데이터셋 | Hugging Face / AI Hub | 대용량 | Apache 2.0 | 가능 |
| 한국어 질문 자동 생성(QG) 데이터셋 | 한국어 지시문 학습 데이터셋 | Hugging Face | 소용량 | Apache 2.0 | 가능 |
| 한국어 질의응답 데이터셋 1.0 (KorQuAD) | 한국어 QA 데이터셋 | KorQuAD 공식 | 중용량 | CC BY-ND 4.0 | 가능 |
| 한국어 AI 모델 불법 및 탈옥 거부 응답 데이터셋 | 한국어 NLP 데이터셋 | Hugging Face | 소용량 | Apache 2.0 | 가능 |
| 한국어 Function Calling 도구 사용 데이터셋 | 한국어 지시문 학습 데이터셋 | Hugging Face (gyung) | 소용량 | Apache 2.0 | 가능 |
| 한국인 고유 영어 발음 및 평가 음성 | 한국어 음성 데이터셋 | AI Hub | 140시간 | AI Hub 이용안내 | 조건부 가능 |
| 한국인 다양한 연령대 자필 손글씨 폰트 | 한국어 OCR 데이터셋 | AI Hub | 140GB | AI Hub 이용안내 | 조건부 가능 |
| 한국인 단어 연상 의미망 코퍼스 | 한국어 사전학습 코퍼스 | GitHub | 소용량 | MIT | 가능 |
| 한국인 생활 상식 및 논리적 연쇄 추론 데이터 | 한국어 LLM 벤치마크 | Hugging Face / GitHub | 중용량 | Apache 2.0 | 가능 |
| 한국인 안면 특징 및 미세 표정 변화 | 한국어 비전 데이터셋 | AI Hub | 2.4TB | AI Hub 이용안내 | 조건부 가능 |
| 한국인 외래어 한영 발음 전사 | 한국어 번역 데이터셋 | AI Hub | 55MB | AI Hub 이용안내 | 조건부 가능 |
| 한문 한자-한글 대칭 수동 번역 데이터셋 | 한국어 번역 데이터셋 | GitHub | 중용량 | CC0 | 가능 |
| 한식 단품 요리 및 반찬 다각도 이미지 | 한국어 비전 데이터셋 | AI Hub | 420GB | AI Hub 이용안내 | 조건부 가능 |
| 해양 한반도 연안 수중 플라스틱 폐기물 | 한국어 비전 데이터셋 | AI Hub | 210GB | AI Hub 이용안내 | 조건부 가능 |
| 호흡기 기침 및 비정상 호흡 사운드 | 한국어 음성 데이터셋 | AI Hub | 15GB | AI Hub 이용안내 | 조건부 가능 |
| APEACH 한국어 혐오 표현 평가셋 | 한국어 LLM 벤치마크 | Hugging Face | 1.1MB | CC BY-SA 4.0 | 가능 |
| BEEP! Korean Hate Speech | 한국어 유해성 데이터셋 | GitHub | 1.2MB | CC BY-SA 4.0 | 조건부 가능 |
| CCTV 지하철 통로 주취 폭행 및 배회 | 한국어 비전 데이터셋 | AI Hub | 5TB | AI Hub 이용안내 | 조건부 가능 |
| CLIcK (Cultural & Legal Knowledge) | 한국어 LLM 벤치마크 | GitHub | 5.5MB | 원본 확인 | 가능 |
| ClovaCall | 한국어 음성인식 데이터셋 | GitHub | 11,000명 이상 | MIT | 불가 |
| COYO-700M (카카오브레인) | 한국어 비전 데이터셋 | Hugging Face | 대용량 (7억 쌍) | CC BY 4.0 | 가능 |
| CSAT-KOREAN-2025 대학수학능력시험 국어 데이터셋 | 한국어 QA 데이터셋 | Hugging Face (KKACHI-HUB) | 3.2MB | MIT | 가능 |
| DKTC (Dataset of Korean Threat Dialogue) | 한국어 대화 데이터셋 | GitHub | 1.8MB | CC BY-NC-SA 4.0 | 불가 |
| FunctionChat-Bench 한국어 도구 호출 | 한국어 LLM 벤치마크 | GitHub | 500 단일턴 + 45 멀티턴 | Apache 2.0 | 가능 |
| GovOn Legal Response Dataset | 한국어 QA 데이터셋 | Hugging Face | 267 MB | CC BY 4.0 | 가능 |
| GSM8K 한국어 번역 수학 데이터셋 | 한국어 번역 데이터셋 | Hugging Face | 4.8MB | MIT | 가능 |
| HAE-RAE Bench 1.1 | 한국어 LLM 벤치마크 | Hugging Face | 2.9MB | CC BY-NC-ND 4.0 | 조건부 가능 |
| HAE-RAE Bench 2.0 | 한국어 LLM 벤치마크 | Hugging Face | 1.0MB | MIT | 가능 |
| HAE-RAE CoT 1.5M | 한국어 NLP 데이터셋 | Hugging Face | 1.05GB | CC BY 4.0 | 가능 |
| HateScore 한국어 다중 차원 혐오 감지 데이터셋 | 한국어 유해성 데이터셋 | GitHub | 중용량 | Apache 2.0 | 가능 |
| HRM8K (HAE-RAE Math 8K) | 한국어 LLM 벤치마크 | Hugging Face | 4.9MB | MIT | 가능 |
| HRMCR 다단계 한국 상식 추론 | 한국어 LLM 벤치마크 | Hugging Face | 106KB | Apache 2.0 | 가능 |
| Jejueo JIT/JSS 제주어 병렬·음성 | 한국어 번역 데이터셋 | GitHub | 170K+ 병렬 문장, 10K 음성 | Apache 2.0 | 가능 |
| K-패션 의류 및 코디 메타데이터 | 한국어 비전 데이터셋 | AI Hub | 850GB | AI Hub 이용안내 | 조건부 가능 |
| K-BrowseComp 한국어 웹 브라우징 에이전트 벤치마크 | 한국어 LLM 벤치마크 | Hugging Face (prometheus-eval) | 3.5MB | MIT | 가능 |
| K-HATERS 대상별 공격성 코퍼스 | 한국어 유해성 데이터셋 | Hugging Face | 50.5MB | CC BY 4.0 | 가능 |
| K-MHaS 다중 라벨 혐오 발화 | 한국어 유해성 데이터셋 | Hugging Face | 9.1MB | CC BY-SA 4.0 | 가능 |
| K-MMBench 한국어 비전-언어 벤치마크 | 한국어 비전 데이터셋 | Hugging Face | 92.4MB | CC BY-NC 4.0 | 조건부 가능 |
| K-POP 노래 가사 다국어 번역 및 한글 로마자 | 한국어 번역 데이터셋 | GitHub | 2.5MB | 원본 확인 | 가능 |
| K²-Eval 한국 문화 지시 평가 | 한국어 지시문 학습 데이터셋 | Hugging Face | 178KB | MIT | 가능 |