모음
한국어 대화 데이터셋
24 개 · GearDel
기어델 카탈로그에서 이 주제는 24개입니다 (텍스트 24개). 제공처: Hugging Face 3개, AI Hub 6개, GitHub 6개. 예: 한국어 대화 요약 데이터셋, DKTC (Dataset of Korean Threat Dialogue), 모두의 말뭉치: 뉴스. 상업 이용 가능 표기는 9개입니다. 대화 말뭉치는 챗·요약에 맞습니다. 화자 라벨과 개인정보 규칙은 제공처마다 다릅니다. 기어델은 파일을 호스팅하지 않으니 원본 링크에서 받으세요.
받기 전에 라이선스와 제공처를 비교하세요. 24개 중 9개가 상업 이용 가능 표기입니다.
| 이름 | 용도 | 제공처 | 크기 | 라이선스 | 상업이용 |
|---|---|---|---|---|---|
| 한국어 대화 요약 데이터셋 | 한국어 요약 데이터셋 | AI Hub | 대용량 | AI Hub 이용안내 | 조건부 가능 |
| DKTC (Dataset of Korean Threat Dialogue) | 한국어 대화 데이터셋 | GitHub | 1.8MB | CC BY-NC-SA 4.0 | 불가 |
| 모두의 말뭉치: 뉴스 | 한국어 대화 데이터셋 | 국립국어원 | 대용량 | 국립국어원 사용서약 | 조건부 가능 |
| 모두의 말뭉치: 메신저 | 한국어 대화 데이터셋 | 국립국어원 | 3.5MB | 국립국어원 사용서약 | 조건부 가능 |
| 모두의 말뭉치: 일상 대화 | 한국어 대화 데이터셋 | 국립국어원 | 24.5MB | 국립국어원 사용서약 | 조건부 가능 |
| 모두의 말뭉치: 웹 문서 | 한국어 대화 데이터셋 | 국립국어원 | 1.2GB | 국립국어원 사용서약 | 조건부 가능 |
| 모두의 말뭉치: 구어 | 한국어 대화 데이터셋 | 국립국어원 | 520MB | 국립국어원 사용서약 | 조건부 가능 |
| 모두의 말뭉치: 도서 문장 | 한국어 대화 데이터셋 | 국립국어원 | 850MB | 국립국어원 사용서약 | 조건부 가능 |
| 모두의 말뭉치: 소셜 미디어 | 한국어 대화 데이터셋 | 국립국어원 | 120MB | 국립국어원 사용서약 | 조건부 가능 |
| SNS 소셜 대화 정제 데이터셋 | 한국어 대화 데이터셋 | AI Hub | 980MB | AI Hub 이용안내 | 조건부 가능 |
| 웹 기반 심층 뉴스 말뭉치 | 한국어 대화 데이터셋 | AI Hub | 2.4GB | AI Hub 이용안내 | 조건부 가능 |
| 산업별 전문 도메인 텍스트 말뭉치 | 한국어 대화 데이터셋 | AI Hub | 3.5GB | AI Hub 이용안내 | 조건부 가능 |
| 드라마 및 방송 연극 시나리오 대본 | 한국어 NLP 데이터셋 | AI Hub | 520MB | AI Hub 이용안내 | 조건부 가능 |
| 소셜 인플루언서 가상 멀티턴 메신저 대화 | 한국어 대화 데이터셋 | AI Hub | 310MB | AI Hub 이용안내 | 조건부 가능 |
| 한국어 일상 구어체 대화 데이터셋 | 한국어 대화 데이터셋 | Hugging Face | 대용량 | Apache 2.0 | 가능 |
| 송영숙 한국어 챗봇 문답 데이터셋 | 한국어 감성분석 데이터셋 | GitHub | 소용량 | MIT | 가능 |
| 한국어 위키백과 정제 말뭉치 | 한국어 대화 데이터셋 | GitHub | 중용량 | CC BY-SA 4.0 | 가능 |
| WanJuanSiLu 한국어 고품질 웹 텍스트 코퍼스 | 한국어 대화 데이터셋 | Hugging Face (opendatalab) | 124 GB | CC BY 4.0 | 가능 |
| KoELECTRA 보캡 최적화 원시 텍스트 말뭉치 | 한국어 대화 데이터셋 | GitHub (monologg) | 대용량 (34GB) | Apache 2.0 | 가능 |
| 한국 근현대 시 문학 말뭉치 | 한국어 대화 데이터셋 | GitHub | 소용량 | MIT | 가능 |
| 한국어 일상 스몰토크 치챗 코퍼스 | 한국어 감성분석 데이터셋 | GitHub | 중용량 | MIT | 가능 |
| 한국어 AI 모델 불법 및 탈옥 거부 응답 데이터셋 | 한국어 NLP 데이터셋 | Hugging Face | 소용량 | Apache 2.0 | 가능 |
| KoDialogBench 대화 이해 벤치마크 | 한국어 LLM 벤치마크 | Hugging Face | 82,962 예제, 21개 테스트셋 | CC BY-NC-SA 4.0 | 조건부 가능 |
| FunctionChat-Bench 한국어 도구 호출 | 한국어 LLM 벤치마크 | GitHub | 500 단일턴 + 45 멀티턴 | Apache 2.0 | 가능 |