모음
한국어 LLM 학습용 데이터셋
46 개 · GearDel
기어델 카탈로그에서 이 주제는 46개입니다 (텍스트 46개). 제공처: Hugging Face 29개, AI Hub 2개, GitHub 6개. 예: KULLM-v2 (한국어 지시문), KoAlpaca-v1.1a, KoGPT2 기본 사전학습 코퍼스. 상업 이용 가능 표기는 41개입니다. 기어델은 파일을 호스팅하지 않으니 원본 링크에서 받으세요.
받기 전에 라이선스와 제공처를 비교하세요. 46개 중 41개가 상업 이용 가능 표기입니다.
| 이름 | 용도 | 제공처 | 크기 | 라이선스 | 상업이용 |
|---|---|---|---|---|---|
| KULLM-v2 (한국어 지시문) | 한국어 지시문 학습 데이터셋 | Hugging Face | 180MB | Apache 2.0 | 가능 |
| KoAlpaca-v1.1a | 한국어 지시문 학습 데이터셋 | Hugging Face | 대용량 | 원본 확인 | 가능 |
| KoGPT2 기본 사전학습 코퍼스 | 한국어 사전학습 코퍼스 | Hugging Face | 3.2GB | 원본 확인 | 가능 |
| 웹 기반 심층 뉴스 말뭉치 | 한국어 대화 데이터셋 | AI Hub | 2.4GB | AI Hub 이용안내 | 조건부 가능 |
| 산업별 전문 도메인 텍스트 말뭉치 | 한국어 대화 데이터셋 | AI Hub | 3.5GB | AI Hub 이용안내 | 조건부 가능 |
| TinyStories 한국어 번역 데이터셋 | 한국어 번역 데이터셋 | Hugging Face | 대용량 | MIT | 가능 |
| 한국어 사전학습 위키 코퍼스 | 한국어 사전학습 코퍼스 | Hugging Face | 중용량 | MIT | 가능 |
| 오픈 한국어 인스트럭션 데이터셋 | 한국어 지시문 학습 데이터셋 | Hugging Face | 대용량 | MIT | 가능 |
| QARV 한국어 인스트럭션 데이터셋 | 한국어 지시문 학습 데이터셋 | Hugging Face | 중용량 | MIT | 가능 |
| Orca 한국어 DPO 선호도 데이터셋 | 한국어 NLP 데이터셋 | Hugging Face | 중용량 | Apache 2.0 | 가능 |
| 한국어 상업용 지시어 데이터셋 | 한국어 지시문 학습 데이터셋 | Hugging Face | 대용량 | MIT | 가능 |
| 캐럿AI 한국어 지시어 데이터셋 | 한국어 지시문 학습 데이터셋 | Hugging Face | 소용량 | Apache 2.0 | 가능 |
| 한국어 금융 특화 지시어 데이터셋 | 한국어 지시문 학습 데이터셋 | Hugging Face | 중용량 | MIT | 가능 |
| 한국어 인공 교과서 코퍼스 데이터셋 | 한국어 사전학습 코퍼스 | Hugging Face | 대용량 | Apache 2.0 | 가능 |
| 카카오엔터프라이즈 한국어 멀티턴 적대적 대화 데이터셋 | 한국어 지시문 학습 데이터셋 | GitHub | 소용량 | Apache 2.0 | 가능 |
| LIMA 한국어 고품질 극소정예 데이터셋 | 한국어 지시문 학습 데이터셋 | Hugging Face | 소용량 | CC BY-NC-SA 4.0 | 가능 |
| 한국어 교육용 필터링 웹텍스트 데이터셋 | 한국어 사전학습 코퍼스 | Hugging Face (devngho) | 대용량 | MIT | 가능 |
| 엘리스 한국어 FineWeb-Edu 데모 데이터셋 | 한국어 사전학습 코퍼스 | Hugging Face (eliceai) | 중용량 | Apache 2.0 | 가능 |
| 교과서 기반 에듀케이션 한국어 말뭉치 | 한국어 지시문 학습 데이터셋 | Hugging Face (devngho) | 대용량 | MIT | 가능 |
| 다양한 문체 변환 한국어 인스트럭션 | 한국어 지시문 학습 데이터셋 | Hugging Face (coastral) | 중용량 | Apache 2.0 | 가능 |
| 한국어 Function Calling 도구 사용 데이터셋 | 한국어 지시문 학습 데이터셋 | Hugging Face (gyung) | 소용량 | Apache 2.0 | 가능 |
| 한국어 위키백과 정제 말뭉치 | 한국어 대화 데이터셋 | GitHub | 중용량 | CC BY-SA 4.0 | 가능 |
| 실생활 한국어 비유 표현 수집 코퍼스 | 한국어 사전학습 코퍼스 | Hugging Face | 소용량 | MIT | 가능 |
| 한국어 오탈자 및 띄어쓰기 문장 교정 코퍼스 | 한국어 사전학습 코퍼스 | GitHub | 중용량 | MIT | 가능 |
| 한국어 질문 자동 생성(QG) 데이터셋 | 한국어 지시문 학습 데이터셋 | Hugging Face | 소용량 | Apache 2.0 | 가능 |
| WanJuanSiLu 한국어 고품질 웹 텍스트 코퍼스 | 한국어 대화 데이터셋 | Hugging Face (opendatalab) | 124 GB | CC BY 4.0 | 가능 |
| KREW 한국어 페르소나 역할극(Role-Playing) 데이터셋 | 한국어 지시문 학습 데이터셋 | Hugging Face (huggingface-KREW) | 28MB | Apache 2.0 | 가능 |
| 서울대 Ko-WinoGrande 한국어 대명사 지시 추론 데이터셋 | 한국어 지시문 학습 데이터셋 | Hugging Face (thunder-research-group) | 4.2MB | CC BY 4.0 | 가능 |
| SmileStyle 한국어 다채로운 문체 변환 코퍼스 | 한국어 사전학습 코퍼스 | GitHub (smilegate-ai) | 35MB | MIT | 가능 |
| KoCoSa 한국어 세부적 상식 추론 지시 데이터셋 | 한국어 지시문 학습 데이터셋 | GitHub | 18MB | Apache 2.0 | 가능 |
| 한국어 일반 의학 및 자가 진단 상담 데이터셋 | 한국어 NLP 데이터셋 | Hugging Face | 중용량 | Apache 2.0 | 가능 |
| 한국어 생활 법률 민원 지식 데이터셋 | 한국어 NLP 데이터셋 | Hugging Face | 중용량 | Apache 2.0 | 가능 |
| Ko-Llama 다각적 지시어 미세조정 데이터셋 | 한국어 지시문 학습 데이터셋 | Hugging Face | 대용량 | Apache 2.0 | 가능 |
| 한국인 단어 연상 의미망 코퍼스 | 한국어 사전학습 코퍼스 | GitHub | 소용량 | MIT | 가능 |
| 한국어 전문 한자 용어 쉬운 말 풀이 코퍼스 | 한국어 사전학습 코퍼스 | Hugging Face | 소용량 | Apache 2.0 | 가능 |
| 한국어 기초 간호 기록지 익명 명세 코퍼스 | 한국어 사전학습 코퍼스 | GitHub | 중용량 | Apache 2.0 | 가능 |
| 한국어 AI 모델 불법 및 탈옥 거부 응답 데이터셋 | 한국어 NLP 데이터셋 | Hugging Face | 소용량 | Apache 2.0 | 가능 |
| KIT-19 — 한국어 인스트럭션 19개 태스크 | 한국어 지시문 학습 데이터셋 | Hugging Face | 85MB | CC BY 4.0 | 가능 |
| Korean Open-ORPO SFT+DPO | 한국어 지시문 학습 데이터셋 | Hugging Face | 65MB | Apache 2.0 | 가능 |
| KoAlpaca v1.0 (번역 Alpaca) | 한국어 지시문 학습 데이터셋 | Hugging Face | 8.1MB | CC BY-NC 4.0 | 조건부 가능 |
| KOpen-Platypus | 한국어 지시문 학습 데이터셋 | Hugging Face | 15.9MB | CC BY 4.0 | 가능 |
| OpenAssistant Guanaco 한국어 | 한국어 지시문 학습 데이터셋 | Hugging Face | 16.7MB | Apache 2.0 | 가능 |
| KcBERT 사전학습 댓글 코퍼스 | 한국어 사전학습 코퍼스 | Hugging Face | 7.90 GiB | CC BY-SA 4.0 | 가능 |
| OpenOrca-KO | 한국어 지시문 학습 데이터셋 | Hugging Face | 21.8MB | MIT | 가능 |
| 한국어 위키백과 교육용 필터 코퍼스 | 한국어 사전학습 코퍼스 | Hugging Face | 764MB | CC BY-SA 4.0 | 조건부 가능 |
| xP3x 한국어 프롬프트 서브셋 | 한국어 지시문 학습 데이터셋 | Hugging Face | 한글 4,642,468행 | Apache 2.0 | 조건부 가능 |