가이드

기어델에서 한국어 AI 데이터셋 고르는 법

카탈로그에는 지금 286개가 있습니다. 데이터가 모자라서 실패하는 경우는 거의 없습니다. 벤치마크를 학습 데이터로 받거나, AI Hub 자료를 MIT처럼 내려받을 때 문제가 납니다.

1. 이름보다 과제를 먼저 정합니다

지금은 텍스트 215개, 이미지 33개, 음성 38개입니다. OCR은 이미지 데이터 아무거나가 아닙니다. 음성 인식과 음성 합성도 다르고, 지시문으로 모델을 다듬는 일과 사전학습용 말뭉치를 모으는 일도 다릅니다. 무엇을 할지 정하지 않고 검색하면 이름만 유명한 데이터가 먼저 나옵니다.

과제가 정해졌다면 음성, OCR, 지시문, 벤치마크 모음을 보는 편이 낫습니다. 라이선스나 제공처를 이미 알고 있다면 홈 화면 필터가 더 빠릅니다.

2. 평가용과 학습용을 나눕니다

이 카탈로그의 KLUE, KoBEST, KMMLU 계열은 점수를 매기는 데이터입니다. 시험용 문항으로 학습하면 점수는 올라가지만, 실제로 쓸 수 있는 모델이 되지는 않습니다. 모음 제목에 벤치마크가 있으면 학습용 말뭉치 목록으로 보지 않는 것이 좋습니다.

3. 용량보다 라이선스를 봅니다

상업적으로 쓸 수 없는 1,000시간 음성은 이득이 아닙니다. 상업 이용 가능으로 표시된 항목이 161개여도, AI Hub 이용안내는 92개입니다. 기어델에 적힌 용량은 원본 사이트에서 가져온 표기이며, 다시 잰 값이 아닙니다.

카탈로그 라이선스 비교 →

4. 원본 주소를 기준으로 합니다

원본 주소가 확인된 항목은 130개입니다. 재확인이거나 미확인이면 Hugging Face 아이디를 짐작하기보다, 제공처에서 데이터셋 이름으로 찾는 것이 안전합니다. 기어델은 파일을 보관하지 않습니다. 원본이 사라지면 깨진 페이지를 남기지 않고 홈으로 보냅니다.

5. 이렇게 고르면 됩니다

  1. 과제에 맞는 모음을 엽니다.
  2. 라이선스가 확인된 항목부터 보고, 바로 받을 수 있는 제공처인지 가립니다. Hugging Face와 AI Hub는 가입 조건이 다릅니다.
  3. 스무 개를 열어보지 않고 두세 개 상세만 연 뒤, ‘이 데이터셋이 맞는 경우’를 읽습니다.
  4. 원본 안내로 이동합니다. 기어델과 원본이 다르면 원본을 따릅니다.

자주 묻는 질문 →