데이터셋 / 텍스트
💡
보캡빌드일렉트라원시말뭉치토크나이저
KoELECTRA 보캡 최적화 원시 텍스트 말뭉치
한국어 ELECTRA 모델 학습 및 어휘 사전(Vocabulary) 구성을 위해 나무위키, 위키백과, 뉴스 기사 등을 골고루 배합하고 신뢰성 높은 토큰들만 정밀 샘플링한 데이터셋입니다.
출처
GitHub (monologg)
등록 연도
2020
데이터 크기
대용량 (34GB)
구성
수백만 토큰 시퀀스
DATA PREVIEW
이런 형태의 데이터예요
아래는 데이터 구조를 이해하기 위한 예시입니다. 실제 내려받기 전에는 원본 제공처의 최신 안내를 확인하세요.
가공 원문
토크나이저는 문장을 인공지능이 분석하기 쉬운 정수 시퀀스 형태로 끊어내는 필수적인 전처리 모듈입니다.