한국어 사전학습 코퍼스 · 텍스트

💬
사전학습위키피디아코퍼스

한국어 사전학습 위키 코퍼스

한국어 사전학습 코퍼스·Korean Pretraining Corpus

한국어 Foundation Model 학습을 위해 한국어 위키피디아 덤프 및 공개 데이터를 결합하여 정제 및 토큰화한 필수 코퍼스 데이터입니다.

Source VerifiedLicense Verified
Commercial use: 가능(catalog)

Source

Hugging Face

License

MIT

Catalog verified

Language

Korean

Needs review

Format

Text

Needs review

Size

중용량

5.8K 토큰 시퀀스

Year

2025

이 데이터셋이 맞는 경우

한국어 사전학습 위키 코퍼스는 Hugging Face에서 제공하는 한국어 사전학습 코퍼스입니다. 태그: 사전학습, 위키피디아, 코퍼스. 라이선스 표기: MIT. 카탈로그 기준으로는 상업 이용 가능으로 표시되어 있습니다. GearDel은 탐색 카탈로그이며 파일을 호스팅하지 않습니다.

과제 / 카테고리
텍스트 · 텍스트 · 사전학습, 위키피디아, 코퍼스
Language
Korean
Format · Size
Text · 중용량 (5.8K 토큰 시퀀스)
License
MIT(Catalog verified) · License document
Source & original link
Hugging Face · Original dataset link(Verified)
Verification status
Source: Verified · License: Verified · Last checked: 2026-09-03

한국어 사전학습 위키 코퍼스: Korean Pretraining Corpus from Hugging Face. License MIT. Open the original link to download.

비슷한 데이터셋

같은 유형·태그·제공처를 공유하는 카탈로그 항목입니다.

SAMPLE

Example records

Catalog samples only. Actual files may differ on the original source.

정제 본문

인공지능은 인간의 지능적인 행동을 컴퓨터가 모방하도록 연구하는 컴퓨터 과학의 한 분야로, 머신러닝과 딥러닝을 포괄합니다.

Trust & metadata

GearDel does not host datasets. Status below is catalog metadata and may differ from the original provider.

Source
Hugging FaceVerified
License
MITVerified
Verification
License verified
Language
KoreanNeeds review
Format
TextNeeds review
Size
중용량Not verified
Last checked
2026-09-03
Always re-check license and terms on the original page. Standard license document
Open original dataset