자주 묻는 질문

한국어 AI 데이터셋, 자주 묻는 질문

지금 카탈로그 286개 기준입니다. 법률 자문이 아닙니다.

기어델에서 파일을 받을 수 있나요?
받을 수 없습니다. 기어델은 파일을 보관하지 않습니다. 데이터셋 카드에서 원본 제공처로 이동합니다. 원본 주소가 미확인이면 제공처에서 데이터셋 이름으로 찾습니다.
AI Hub 데이터는 MIT와 같나요?
이 카탈로그에서 AI Hub 이용안내 표기는 92개입니다. 대개 계정과 별도 동의가 필요합니다. GitHub MIT와 한 표에 놓는 것은 비교용이지, Apache 2.0처럼 받으라는 뜻이 아닙니다.
KLUE, KoBEST, KMMLU로 학습해도 되나요?
그 계열은 점수를 매기는 평가용입니다. 시험 문항으로 학습하면 점수는 올라가지만 쓸 수 있는 모델이 되지는 않습니다. 학습이 필요하면 LLM 학습 모음을 봅니다.
상업 이용 가능이면 제품에 넣어도 되나요?
가능으로 표시된 항목은 161개입니다. 적힌 라이선스에서 허용 가능성을 읽은 것이지, 출시 허가가 아닙니다. 원본 LICENSE를 다시 읽습니다. AI Hub와 국립국어원은 가입이 남아 있는 경우가 많습니다.
용량 숫자가 실제 파일 크기인가요?
아닙니다. 기어델의 용량은 원본 사이트에서 가져온 표기입니다. 샘플만 공개됐거나, 나눠 받거나, 예전 숫자일 수 있습니다.
원본 페이지가 없어지면 어떻게 되나요?
기어델은 복사본을 두지 않습니다. 원본이 사라지면 깨진 카드를 남기지 않고 홈으로 보냅니다.

고르는 법 → · 라이선스 비교 →