소개
기어델이 하는 일
기어델은 한국어 AI 데이터셋을 찾아보는 카탈로그입니다. 지금은 286개를 출처, 라이선스, 용량, 원본 주소로 정리합니다. 파일은 보관하지 않습니다.
다운로드 미러가 아닌 이유
파일은 이미 Hugging Face, AI Hub, GitHub, 국립국어원이 갖고 있습니다. 어려운 일은 받기 전에 평가용인지 학습용인지, 라이선스가 확인된 값인지, 상업적으로 쓸 수 있는지 가늠하는 것입니다. 기어델은 그 비교를 위해 있습니다.
현재 Hugging Face 계열 113개, AI Hub 계열 96개, GitHub 계열 73개, 국립국어원 7개입니다. 한 데이터셋이 여러 제공처를 적으면 숫자가 겹칩니다.
검증 표시가 붙는 기준
각 데이터셋은 원본 주소, 라이선스, 언어, 형식, 용량을 따로 표시합니다. 확인됨은 사람이 보거나 엄격한 규칙으로 원본 페이지와 값을 맞춘 경우입니다. 재확인 필요는 단서가 있으나 다시 봐야 하는 경우입니다. 미확인은 기어델이 값을 단정하지 않는다는 뜻입니다.
- 라이선스: 확인됨 182개, 재확인 필요 87개, 미확인 17개.
- 원본 주소: 확인됨 130개, 재확인 필요 0개, 미확인 156개.
없는 라이선스를 지어내지 않습니다. 없으면 빈칸으로 둡니다. AI Hub 항목은 MIT인 척하지 않고 제공처 이용안내로 둡니다.
상업 이용 표기
카탈로그 기준 가능 161개, 조건부 가능 120개, 불가 5개입니다. 가능이어도 원본 약관을 다시 읽어야 합니다. AI Hub와 국립국어원은 상업 이용 모음에 있어도 가입·서약이 거의 항상 있습니다.
누가, 어떻게 만드나
한 사람이 항목을 유지합니다. 원본 페이지를 열고 제공처, 라이선스 표기, 용량 문구를 맞춥니다. 파일을 받아 다시 재지는 않습니다. 확인됨은 그 페이지와 값이 같을 때입니다. 라이선스가 없으면 빈칸으로 둡니다. 원본이 404이면 깨진 페이지를 남기지 않고 카탈로그에서 뺍니다.
틀린 표기·빠진 데이터셋: [email protected]
하지 않는 일
- 파일을 보관하거나 라이선스를 다시 부여하지 않습니다. 다운로드는 원본 페이지에서 합니다.
- 카탈로그의 용량 표기가 지금 내려받는 파일 크기와 같다고 보장하지 않습니다.
- 법률 자문을 하지 않습니다. 라이선스 가이드는 이 카탈로그를 읽기 위한 안내입니다.
이어서 읽기
한국어 데이터셋 고르는 법 · 카탈로그 라이선스 비교 · 자주 묻는 질문 · 주제별 모음
수정 요청·데이터셋 제안: [email protected]