한국어 대화 데이터셋 · 텍스트

💡
보캡빌드일렉트라원시말뭉치토크나이저

KoELECTRA 보캡 최적화 원시 텍스트 말뭉치

한국어 대화 데이터셋·Korean Dialogue Dataset

한국어 ELECTRA 모델 학습 및 어휘 사전(Vocabulary) 구성을 위해 나무위키, 위키백과, 뉴스 기사 등을 골고루 배합하고 신뢰성 높은 토큰들만 정밀 샘플링한 데이터셋입니다.

Source VerifiedLicense Verified
Commercial use: 가능(catalog)

Source

GitHub (monologg)

License

Apache 2.0

Catalog verified

Language

Korean

Needs review

Format

Text

Needs review

Size

대용량 (34GB)

수백만 토큰 시퀀스

Year

2020

이 데이터셋이 맞는 경우

KoELECTRA 보캡 최적화 원시 텍스트 말뭉치는 GitHub (monologg)에서 제공하는 한국어 대화 데이터셋입니다. 태그: 보캡빌드, 일렉트라, 원시말뭉치, 토크나이저. 라이선스 표기: Apache 2.0. 카탈로그 기준으로는 상업 이용 가능으로 표시되어 있습니다. GearDel은 탐색 카탈로그이며 파일을 호스팅하지 않습니다.

과제 / 카테고리
텍스트 · 텍스트 · 보캡빌드, 일렉트라, 원시말뭉치, 토크나이저
Language
Korean
Format · Size
Text · 대용량 (34GB) (수백만 토큰 시퀀스)
License
Apache 2.0(Catalog verified) · License document
Source & original link
GitHub (monologg) · Original dataset link(Verified)
Verification status
Source: Verified · License: Verified · Last checked: 2026-09-03

KoELECTRA 보캡 최적화 원시 텍스트 말뭉치: Korean Dialogue Dataset from GitHub (monologg). License Apache 2.0. Open the original link to download.

비슷한 데이터셋

같은 유형·태그·제공처를 공유하는 카탈로그 항목입니다.

SAMPLE

Example records

Catalog samples only. Actual files may differ on the original source.

가공 원문

토크나이저는 문장을 인공지능이 분석하기 쉬운 정수 시퀀스 형태로 끊어내는 필수적인 전처리 모듈입니다.

Trust & metadata

GearDel does not host datasets. Status below is catalog metadata and may differ from the original provider.

Source
GitHub (monologg)Verified
License
Apache 2.0Verified
Verification
License verified
Language
KoreanNeeds review
Format
TextNeeds review
Size
대용량 (34GB)Needs review
Last checked
2026-09-03
Always re-check license and terms on the original page. Standard license document
Open original dataset