GGearDel← 데이터셋 목록

데이터셋 / 텍스트

사전학습말뭉치웹텍스트OpenDataLab

WanJuanSiLu 한국어 고품질 웹 텍스트 코퍼스

저자원 언어 및 한국어 Foundation Model의 사전학습 성능을 상향 평준화하기 위해 수집된 대규모 텍스트 데이터셋으로, 정밀 휴리스틱 및 인공지능 클린 필터링 공정을 통과한 고신뢰도 웹 말뭉치입니다.

상업적 이용 가능 (Apache 2.0)

출처

Hugging Face (opendatalab)

등록 연도

2025

데이터 크기

124 GB

구성

대규모 웹코퍼스 패키지

원본 데이터셋에서 보기

DATA PREVIEW

이런 형태의 데이터예요

아래는 데이터 구조를 이해하기 위한 예시입니다. 실제 내려받기 전에는 원본 제공처의 최신 안내를 확인하세요.

정제 코퍼스

한국의 전통적인 난방 시스템인 온돌은 방바닥 밑에 돌과 통로를 만들어 아궁이의 열기가 바닥을 데우고 빠져나가게 고안된 과학적인 공법입니다.