자주 묻는 질문
한국어 AI 데이터셋, 자주 묻는 질문
지금 카탈로그 286개 기준입니다. 법률 자문이 아닙니다.
- 기어델에서 파일을 받을 수 있나요?
- 받을 수 없습니다. 기어델은 파일을 보관하지 않습니다. 데이터셋 카드에서 원본 제공처로 이동합니다. 원본 주소가 미확인이면 제공처에서 데이터셋 이름으로 찾습니다.
- AI Hub 데이터는 MIT와 같나요?
- 이 카탈로그에서 AI Hub 이용안내 표기는 92개입니다. 대개 계정과 별도 동의가 필요합니다. GitHub MIT와 한 표에 놓는 것은 비교용이지, Apache 2.0처럼 받으라는 뜻이 아닙니다.
- KLUE, KoBEST, KMMLU로 학습해도 되나요?
- 그 계열은 점수를 매기는 평가용입니다. 시험 문항으로 학습하면 점수는 올라가지만 쓸 수 있는 모델이 되지는 않습니다. 학습이 필요하면 LLM 학습 모음을 봅니다.
- 상업 이용 가능이면 제품에 넣어도 되나요?
- 가능으로 표시된 항목은 161개입니다. 적힌 라이선스에서 허용 가능성을 읽은 것이지, 출시 허가가 아닙니다. 원본 LICENSE를 다시 읽습니다. AI Hub와 국립국어원은 가입이 남아 있는 경우가 많습니다.
- 용량 숫자가 실제 파일 크기인가요?
- 아닙니다. 기어델의 용량은 원본 사이트에서 가져온 표기입니다. 샘플만 공개됐거나, 나눠 받거나, 예전 숫자일 수 있습니다.
- 원본 페이지가 없어지면 어떻게 되나요?
- 기어델은 복사본을 두지 않습니다. 원본이 사라지면 깨진 카드를 남기지 않고 홈으로 보냅니다.