모음
한국어 LLM 학습 데이터셋
63 개 · GearDel
기어델 카탈로그에서 이 주제는 63개입니다 (텍스트 63개). 제공처: Hugging Face 30개, AI Hub 6개, GitHub 10개. 예: 한국어 대화 요약 데이터셋, KULLM-v2 (한국어 지시문), KoAlpaca-v1.1a. 상업 이용 가능 표기는 46개입니다. 기어델은 파일을 호스팅하지 않으니 원본 링크에서 받으세요.
받기 전에 라이선스와 제공처를 비교하세요. 63개 중 46개가 상업 이용 가능 표기입니다.
| 이름 | 용도 | 제공처 | 크기 | 라이선스 | 상업이용 |
|---|---|---|---|---|---|
| 한국어 대화 요약 데이터셋 | 한국어 요약 데이터셋 | AI Hub | 대용량 | AI Hub 이용안내 | 조건부 가능 |
| KULLM-v2 (한국어 지시문) | 한국어 지시문 학습 데이터셋 | Hugging Face | 180MB | Apache 2.0 | 가능 |
| KoAlpaca-v1.1a | 한국어 지시문 학습 데이터셋 | Hugging Face | 대용량 | 원본 확인 | 가능 |
| DKTC (Dataset of Korean Threat Dialogue) | 한국어 대화 데이터셋 | GitHub | 1.8MB | CC BY-NC-SA 4.0 | 불가 |
| 모두의 말뭉치: 뉴스 | 한국어 대화 데이터셋 | 국립국어원 | 대용량 | 국립국어원 사용서약 | 조건부 가능 |
| 모두의 말뭉치: 메신저 | 한국어 대화 데이터셋 | 국립국어원 | 3.5MB | 국립국어원 사용서약 | 조건부 가능 |
| 모두의 말뭉치: 일상 대화 | 한국어 대화 데이터셋 | 국립국어원 | 24.5MB | 국립국어원 사용서약 | 조건부 가능 |
| 모두의 말뭉치: 웹 문서 | 한국어 대화 데이터셋 | 국립국어원 | 1.2GB | 국립국어원 사용서약 | 조건부 가능 |
| 모두의 말뭉치: 구어 | 한국어 대화 데이터셋 | 국립국어원 | 520MB | 국립국어원 사용서약 | 조건부 가능 |
| 모두의 말뭉치: 도서 문장 | 한국어 대화 데이터셋 | 국립국어원 | 850MB | 국립국어원 사용서약 | 조건부 가능 |
| 모두의 말뭉치: 소셜 미디어 | 한국어 대화 데이터셋 | 국립국어원 | 120MB | 국립국어원 사용서약 | 조건부 가능 |
| KoGPT2 기본 사전학습 코퍼스 | 한국어 사전학습 코퍼스 | Hugging Face | 3.2GB | 원본 확인 | 가능 |
| SNS 소셜 대화 정제 데이터셋 | 한국어 대화 데이터셋 | AI Hub | 980MB | AI Hub 이용안내 | 조건부 가능 |
| 웹 기반 심층 뉴스 말뭉치 | 한국어 대화 데이터셋 | AI Hub | 2.4GB | AI Hub 이용안내 | 조건부 가능 |
| 산업별 전문 도메인 텍스트 말뭉치 | 한국어 대화 데이터셋 | AI Hub | 3.5GB | AI Hub 이용안내 | 조건부 가능 |
| 드라마 및 방송 연극 시나리오 대본 | 한국어 NLP 데이터셋 | AI Hub | 520MB | AI Hub 이용안내 | 조건부 가능 |
| 소셜 인플루언서 가상 멀티턴 메신저 대화 | 한국어 대화 데이터셋 | AI Hub | 310MB | AI Hub 이용안내 | 조건부 가능 |
| TinyStories 한국어 번역 데이터셋 | 한국어 번역 데이터셋 | Hugging Face | 대용량 | MIT | 가능 |
| 한국어 사전학습 위키 코퍼스 | 한국어 사전학습 코퍼스 | Hugging Face | 중용량 | MIT | 가능 |
| 오픈 한국어 인스트럭션 데이터셋 | 한국어 지시문 학습 데이터셋 | Hugging Face | 대용량 | MIT | 가능 |
| QARV 한국어 인스트럭션 데이터셋 | 한국어 지시문 학습 데이터셋 | Hugging Face | 중용량 | MIT | 가능 |
| Orca 한국어 DPO 선호도 데이터셋 | 한국어 NLP 데이터셋 | Hugging Face | 중용량 | Apache 2.0 | 가능 |
| 한국어 상업용 지시어 데이터셋 | 한국어 지시문 학습 데이터셋 | Hugging Face | 대용량 | MIT | 가능 |
| 캐럿AI 한국어 지시어 데이터셋 | 한국어 지시문 학습 데이터셋 | Hugging Face | 소용량 | Apache 2.0 | 가능 |
| 한국어 금융 특화 지시어 데이터셋 | 한국어 지시문 학습 데이터셋 | Hugging Face | 중용량 | MIT | 가능 |
| 한국어 일상 구어체 대화 데이터셋 | 한국어 대화 데이터셋 | Hugging Face | 대용량 | Apache 2.0 | 가능 |
| 송영숙 한국어 챗봇 문답 데이터셋 | 한국어 감성분석 데이터셋 | GitHub | 소용량 | MIT | 가능 |
| 한국어 인공 교과서 코퍼스 데이터셋 | 한국어 사전학습 코퍼스 | Hugging Face | 대용량 | Apache 2.0 | 가능 |
| 카카오엔터프라이즈 한국어 멀티턴 적대적 대화 데이터셋 | 한국어 지시문 학습 데이터셋 | GitHub | 소용량 | Apache 2.0 | 가능 |
| LIMA 한국어 고품질 극소정예 데이터셋 | 한국어 지시문 학습 데이터셋 | Hugging Face | 소용량 | CC BY-NC-SA 4.0 | 가능 |
| 한국어 교육용 필터링 웹텍스트 데이터셋 | 한국어 사전학습 코퍼스 | Hugging Face (devngho) | 대용량 | MIT | 가능 |
| 엘리스 한국어 FineWeb-Edu 데모 데이터셋 | 한국어 사전학습 코퍼스 | Hugging Face (eliceai) | 중용량 | Apache 2.0 | 가능 |
| 교과서 기반 에듀케이션 한국어 말뭉치 | 한국어 지시문 학습 데이터셋 | Hugging Face (devngho) | 대용량 | MIT | 가능 |
| 다양한 문체 변환 한국어 인스트럭션 | 한국어 지시문 학습 데이터셋 | Hugging Face (coastral) | 중용량 | Apache 2.0 | 가능 |
| 한국어 Function Calling 도구 사용 데이터셋 | 한국어 지시문 학습 데이터셋 | Hugging Face (gyung) | 소용량 | Apache 2.0 | 가능 |
| 한국어 위키백과 정제 말뭉치 | 한국어 대화 데이터셋 | GitHub | 중용량 | CC BY-SA 4.0 | 가능 |
| 실생활 한국어 비유 표현 수집 코퍼스 | 한국어 사전학습 코퍼스 | Hugging Face | 소용량 | MIT | 가능 |
| 한국어 오탈자 및 띄어쓰기 문장 교정 코퍼스 | 한국어 사전학습 코퍼스 | GitHub | 중용량 | MIT | 가능 |
| 한국어 질문 자동 생성(QG) 데이터셋 | 한국어 지시문 학습 데이터셋 | Hugging Face | 소용량 | Apache 2.0 | 가능 |
| WanJuanSiLu 한국어 고품질 웹 텍스트 코퍼스 | 한국어 대화 데이터셋 | Hugging Face (opendatalab) | 124 GB | CC BY 4.0 | 가능 |
| KREW 한국어 페르소나 역할극(Role-Playing) 데이터셋 | 한국어 지시문 학습 데이터셋 | Hugging Face (huggingface-KREW) | 28MB | Apache 2.0 | 가능 |
| 서울대 Ko-WinoGrande 한국어 대명사 지시 추론 데이터셋 | 한국어 지시문 학습 데이터셋 | Hugging Face (thunder-research-group) | 4.2MB | CC BY 4.0 | 가능 |
| SmileStyle 한국어 다채로운 문체 변환 코퍼스 | 한국어 사전학습 코퍼스 | GitHub (smilegate-ai) | 35MB | MIT | 가능 |
| KoCoSa 한국어 세부적 상식 추론 지시 데이터셋 | 한국어 지시문 학습 데이터셋 | GitHub | 18MB | Apache 2.0 | 가능 |
| 한국어 일반 의학 및 자가 진단 상담 데이터셋 | 한국어 NLP 데이터셋 | Hugging Face | 중용량 | Apache 2.0 | 가능 |
| 한국어 생활 법률 민원 지식 데이터셋 | 한국어 NLP 데이터셋 | Hugging Face | 중용량 | Apache 2.0 | 가능 |
| KoELECTRA 보캡 최적화 원시 텍스트 말뭉치 | 한국어 대화 데이터셋 | GitHub (monologg) | 대용량 (34GB) | Apache 2.0 | 가능 |
| 한국 근현대 시 문학 말뭉치 | 한국어 대화 데이터셋 | GitHub | 소용량 | MIT | 가능 |
| 한국어 일상 스몰토크 치챗 코퍼스 | 한국어 감성분석 데이터셋 | GitHub | 중용량 | MIT | 가능 |
| Ko-Llama 다각적 지시어 미세조정 데이터셋 | 한국어 지시문 학습 데이터셋 | Hugging Face | 대용량 | Apache 2.0 | 가능 |
| 한국인 단어 연상 의미망 코퍼스 | 한국어 사전학습 코퍼스 | GitHub | 소용량 | MIT | 가능 |
| 한국어 전문 한자 용어 쉬운 말 풀이 코퍼스 | 한국어 사전학습 코퍼스 | Hugging Face | 소용량 | Apache 2.0 | 가능 |
| 한국어 기초 간호 기록지 익명 명세 코퍼스 | 한국어 사전학습 코퍼스 | GitHub | 중용량 | Apache 2.0 | 가능 |
| 한국어 AI 모델 불법 및 탈옥 거부 응답 데이터셋 | 한국어 NLP 데이터셋 | Hugging Face | 소용량 | Apache 2.0 | 가능 |
| KIT-19 — 한국어 인스트럭션 19개 태스크 | 한국어 지시문 학습 데이터셋 | Hugging Face | 85MB | CC BY 4.0 | 가능 |
| Korean Open-ORPO SFT+DPO | 한국어 지시문 학습 데이터셋 | Hugging Face | 65MB | Apache 2.0 | 가능 |
| KoAlpaca v1.0 (번역 Alpaca) | 한국어 지시문 학습 데이터셋 | Hugging Face | 8.1MB | CC BY-NC 4.0 | 조건부 가능 |
| KOpen-Platypus | 한국어 지시문 학습 데이터셋 | Hugging Face | 15.9MB | CC BY 4.0 | 가능 |
| OpenAssistant Guanaco 한국어 | 한국어 지시문 학습 데이터셋 | Hugging Face | 16.7MB | Apache 2.0 | 가능 |
| KcBERT 사전학습 댓글 코퍼스 | 한국어 사전학습 코퍼스 | Hugging Face | 7.90 GiB | CC BY-SA 4.0 | 가능 |
| OpenOrca-KO | 한국어 지시문 학습 데이터셋 | Hugging Face | 21.8MB | MIT | 가능 |
| 한국어 위키백과 교육용 필터 코퍼스 | 한국어 사전학습 코퍼스 | Hugging Face | 764MB | CC BY-SA 4.0 | 조건부 가능 |
| xP3x 한국어 프롬프트 서브셋 | 한국어 지시문 학습 데이터셋 | Hugging Face | 한글 4,642,468행 | Apache 2.0 | 조건부 가능 |