모음
한국어 지시문 학습 데이터셋
28 개 · GearDel
기어델 카탈로그에서 이 주제는 28개입니다 (텍스트 28개). 제공처: Hugging Face 21개, GitHub 2개. 예: KULLM-v2 (한국어 지시문), KoAlpaca-v1.1a, KoInFoBench 한국어 지시어 이행 평가 데이터셋. 상업 이용 가능 표기는 26개입니다. 지시문 데이터는 SFT용입니다. 원시 크롤 코퍼스를 대체하지 않습니다. 기어델은 파일을 호스팅하지 않으니 원본 링크에서 받으세요.
받기 전에 라이선스와 제공처를 비교하세요. 28개 중 26개가 상업 이용 가능 표기입니다.
| 이름 | 용도 | 제공처 | 크기 | 라이선스 | 상업이용 |
|---|---|---|---|---|---|
| KULLM-v2 (한국어 지시문) | 한국어 지시문 학습 데이터셋 | Hugging Face | 180MB | Apache 2.0 | 가능 |
| KoAlpaca-v1.1a | 한국어 지시문 학습 데이터셋 | Hugging Face | 대용량 | 원본 확인 | 가능 |
| KoInFoBench 한국어 지시어 이행 평가 데이터셋 | 한국어 지시문 학습 데이터셋 | Hugging Face | 소용량 | MIT | 가능 |
| 오픈 한국어 인스트럭션 데이터셋 | 한국어 지시문 학습 데이터셋 | Hugging Face | 대용량 | MIT | 가능 |
| QARV 한국어 인스트럭션 데이터셋 | 한국어 지시문 학습 데이터셋 | Hugging Face | 중용량 | MIT | 가능 |
| 한국어 상업용 지시어 데이터셋 | 한국어 지시문 학습 데이터셋 | Hugging Face | 대용량 | MIT | 가능 |
| 캐럿AI 한국어 지시어 데이터셋 | 한국어 지시문 학습 데이터셋 | Hugging Face | 소용량 | Apache 2.0 | 가능 |
| 한국어 금융 특화 지시어 데이터셋 | 한국어 지시문 학습 데이터셋 | Hugging Face | 중용량 | MIT | 가능 |
| 카카오엔터프라이즈 한국어 멀티턴 적대적 대화 데이터셋 | 한국어 지시문 학습 데이터셋 | GitHub | 소용량 | Apache 2.0 | 가능 |
| LIMA 한국어 고품질 극소정예 데이터셋 | 한국어 지시문 학습 데이터셋 | Hugging Face | 소용량 | CC BY-NC-SA 4.0 | 가능 |
| 교과서 기반 에듀케이션 한국어 말뭉치 | 한국어 지시문 학습 데이터셋 | Hugging Face (devngho) | 대용량 | MIT | 가능 |
| 다양한 문체 변환 한국어 인스트럭션 | 한국어 지시문 학습 데이터셋 | Hugging Face (coastral) | 중용량 | Apache 2.0 | 가능 |
| 한국어 Function Calling 도구 사용 데이터셋 | 한국어 지시문 학습 데이터셋 | Hugging Face (gyung) | 소용량 | Apache 2.0 | 가능 |
| 한국어 질문 자동 생성(QG) 데이터셋 | 한국어 지시문 학습 데이터셋 | Hugging Face | 소용량 | Apache 2.0 | 가능 |
| KREW 한국어 페르소나 역할극(Role-Playing) 데이터셋 | 한국어 지시문 학습 데이터셋 | Hugging Face (huggingface-KREW) | 28MB | Apache 2.0 | 가능 |
| 서울대 Ko-WinoGrande 한국어 대명사 지시 추론 데이터셋 | 한국어 지시문 학습 데이터셋 | Hugging Face (thunder-research-group) | 4.2MB | CC BY 4.0 | 가능 |
| KoCoSa 한국어 세부적 상식 추론 지시 데이터셋 | 한국어 지시문 학습 데이터셋 | GitHub | 18MB | Apache 2.0 | 가능 |
| 한국어 일반 의학 및 자가 진단 상담 데이터셋 | 한국어 NLP 데이터셋 | Hugging Face | 중용량 | Apache 2.0 | 가능 |
| 한국어 생활 법률 민원 지식 데이터셋 | 한국어 NLP 데이터셋 | Hugging Face | 중용량 | Apache 2.0 | 가능 |
| Ko-Llama 다각적 지시어 미세조정 데이터셋 | 한국어 지시문 학습 데이터셋 | Hugging Face | 대용량 | Apache 2.0 | 가능 |
| KIT-19 — 한국어 인스트럭션 19개 태스크 | 한국어 지시문 학습 데이터셋 | Hugging Face | 85MB | CC BY 4.0 | 가능 |
| Korean Open-ORPO SFT+DPO | 한국어 지시문 학습 데이터셋 | Hugging Face | 65MB | Apache 2.0 | 가능 |
| KoAlpaca v1.0 (번역 Alpaca) | 한국어 지시문 학습 데이터셋 | Hugging Face | 8.1MB | CC BY-NC 4.0 | 조건부 가능 |
| KOpen-Platypus | 한국어 지시문 학습 데이터셋 | Hugging Face | 15.9MB | CC BY 4.0 | 가능 |
| OpenAssistant Guanaco 한국어 | 한국어 지시문 학습 데이터셋 | Hugging Face | 16.7MB | Apache 2.0 | 가능 |
| K²-Eval 한국 문화 지시 평가 | 한국어 지시문 학습 데이터셋 | Hugging Face | 178KB | MIT | 가능 |
| OpenOrca-KO | 한국어 지시문 학습 데이터셋 | Hugging Face | 21.8MB | MIT | 가능 |
| xP3x 한국어 프롬프트 서브셋 | 한국어 지시문 학습 데이터셋 | Hugging Face | 한글 4,642,468행 | Apache 2.0 | 조건부 가능 |