한국어 대화 데이터셋 · 텍스트

사전학습말뭉치웹텍스트OpenDataLab

WanJuanSiLu 한국어 고품질 웹 텍스트 코퍼스

한국어 대화 데이터셋·Korean Dialogue Dataset

저자원 언어 및 한국어 Foundation Model의 사전학습 성능을 상향 평준화하기 위해 수집된 대규모 텍스트 데이터셋으로, 정밀 휴리스틱 및 인공지능 클린 필터링 공정을 통과한 고신뢰도 웹 말뭉치입니다.

Source VerifiedLicense Verified
Commercial use: 가능(catalog)

Source

Hugging Face (opendatalab)

License

CC BY 4.0

Catalog verified

Language

Korean

Needs review

Format

Text

Needs review

Size

124 GB

대규모 웹코퍼스 패키지

Year

2025

이 데이터셋이 맞는 경우

WanJuanSiLu 한국어 고품질 웹 텍스트 코퍼스는 Hugging Face (opendatalab)에서 제공하는 한국어 대화 데이터셋입니다. 태그: 사전학습, 말뭉치, 웹텍스트, OpenDataLab. 라이선스 표기: CC BY 4.0. 카탈로그 기준으로는 상업 이용 가능으로 표시되어 있습니다. GearDel은 탐색 카탈로그이며 파일을 호스팅하지 않습니다.

과제 / 카테고리
텍스트 · 텍스트 · 사전학습, 말뭉치, 웹텍스트, OpenDataLab
Language
Korean
Format · Size
Text · 124 GB (대규모 웹코퍼스 패키지)
License
CC BY 4.0(Catalog verified) · License document
Source & original link
Hugging Face (opendatalab) · Original dataset link(Verified)
Verification status
Source: Verified · License: Verified · Last checked: 2026-09-03

WanJuanSiLu 한국어 고품질 웹 텍스트 코퍼스: Korean Dialogue Dataset from Hugging Face (opendatalab). License CC BY 4.0. Open the original link to download.

비슷한 데이터셋

같은 유형·태그·제공처를 공유하는 카탈로그 항목입니다.

SAMPLE

Example records

Catalog samples only. Actual files may differ on the original source.

정제 코퍼스

한국의 전통적인 난방 시스템인 온돌은 방바닥 밑에 돌과 통로를 만들어 아궁이의 열기가 바닥을 데우고 빠져나가게 고안된 과학적인 공법입니다.

Trust & metadata

GearDel does not host datasets. Status below is catalog metadata and may differ from the original provider.

Source
Hugging Face (opendatalab)Verified
License
CC BY 4.0Verified
Verification
License verified
Language
KoreanNeeds review
Format
TextNeeds review
Size
124 GBNeeds review
Last checked
2026-09-03
Always re-check license and terms on the original page. Standard license document
Open original dataset