한국어 대화 데이터셋 · 텍스트
KoELECTRA 보캡 최적화 원시 텍스트 말뭉치
한국어 대화 데이터셋·Korean Dialogue Dataset
한국어 ELECTRA 모델 학습 및 어휘 사전(Vocabulary) 구성을 위해 나무위키, 위키백과, 뉴스 기사 등을 골고루 배합하고 신뢰성 높은 토큰들만 정밀 샘플링한 데이터셋입니다.
Source
GitHub (monologg)
License
Apache 2.0
Catalog verified
Language
Korean
Needs review
Format
Text
Needs review
Size
대용량 (34GB)
수백만 토큰 시퀀스
Year
2020
이 데이터셋이 맞는 경우
KoELECTRA 보캡 최적화 원시 텍스트 말뭉치는 GitHub (monologg)에서 제공하는 한국어 대화 데이터셋입니다. 태그: 보캡빌드, 일렉트라, 원시말뭉치, 토크나이저. 라이선스 표기: Apache 2.0. 카탈로그 기준으로는 상업 이용 가능으로 표시되어 있습니다. GearDel은 탐색 카탈로그이며 파일을 호스팅하지 않습니다.
- 과제 / 카테고리
- 텍스트 · 텍스트 · 보캡빌드, 일렉트라, 원시말뭉치, 토크나이저
- Language
- Korean
- Format · Size
- Text · 대용량 (34GB) (수백만 토큰 시퀀스)
- License
- Apache 2.0(Catalog verified) · License document
- Source & original link
- GitHub (monologg) · Original dataset link(Verified)
- Verification status
- Source: Verified · License: Verified · Last checked: 2026-09-03
KoELECTRA 보캡 최적화 원시 텍스트 말뭉치: Korean Dialogue Dataset from GitHub (monologg). License Apache 2.0. Open the original link to download.
비슷한 데이터셋
같은 유형·태그·제공처를 공유하는 카탈로그 항목입니다.
SAMPLE
Example records
Catalog samples only. Actual files may differ on the original source.
가공 원문
토크나이저는 문장을 인공지능이 분석하기 쉬운 정수 시퀀스 형태로 끊어내는 필수적인 전처리 모듈입니다.
Trust & metadata
GearDel does not host datasets. Status below is catalog metadata and may differ from the original provider.
- Source
- GitHub (monologg)Verified
- Source URL
- https://github.com/monologg/KoELECTRAVerified
- License
- Apache 2.0Verified
- Verification
- License verified
- Language
- KoreanNeeds review
- Format
- TextNeeds review
- Size
- 대용량 (34GB)Needs review
- Last checked
- 2026-09-03