데이터셋 / 텍스트
✍
사전학습말뭉치웹텍스트OpenDataLab
WanJuanSiLu 한국어 고품질 웹 텍스트 코퍼스
저자원 언어 및 한국어 Foundation Model의 사전학습 성능을 상향 평준화하기 위해 수집된 대규모 텍스트 데이터셋으로, 정밀 휴리스틱 및 인공지능 클린 필터링 공정을 통과한 고신뢰도 웹 말뭉치입니다.
출처
Hugging Face (opendatalab)
등록 연도
2025
데이터 크기
124 GB
구성
대규모 웹코퍼스 패키지
DATA PREVIEW
이런 형태의 데이터예요
아래는 데이터 구조를 이해하기 위한 예시입니다. 실제 내려받기 전에는 원본 제공처의 최신 안내를 확인하세요.
정제 코퍼스
한국의 전통적인 난방 시스템인 온돌은 방바닥 밑에 돌과 통로를 만들어 아궁이의 열기가 바닥을 데우고 빠져나가게 고안된 과학적인 공법입니다.