카탈로그

한국어 AI 데이터셋 이름순 목록

286개 중 241–280 · 7 / 8쪽

홈에 카탈로그 전체를 넣지 않기 위해, 같은 목록을 짧은 HTML 페이지로 나눈 보기입니다. 라이선스와 용량은 저장된 표기입니다. 음성·OCR·지시문·감성은 모음 페이지에 있습니다. 기어델은 파일을 보관하지 않습니다.

과제별로 고르기 →·홈에서 검색 →

이름용도제공처크기라이선스상업이용
KOpen 고품질 에르메스 한국어 데이터셋한국어 번역 데이터셋Hugging Face중용량MIT가능
KOpen-Platypus한국어 지시문 학습 데이터셋Hugging Face15.9MBCC BY 4.0가능
Korean Open-ORPO SFT+DPO한국어 지시문 학습 데이터셋Hugging Face65MBApache 2.0가능
Korean Receipts (금융 영수증 OCR)영수증 OCR 데이터셋Hugging Face95MBCC BY 4.0가능
Korean SAT Math 수능 수학 논리 추론 데이터셋한국어 NLP 데이터셋Hugging Face (Quadyun)8.5MBMIT가능
Korean Tourist Spot Dataset (풍경 이미지)한국어 비전 데이터셋GitHub8.4GB원본 확인가능
Korean-Light-OCR (야외 간판 및 표지판)한국어 OCR 데이터셋GitHub4.2GB원본 확인가능
KorMedMCQA 보건의료 국가시험 QA한국어 QA 데이터셋Hugging Face2.1MBCC BY-NC 4.0조건부 가능
KorNAT 한국 상식·사회가치 QA한국어 QA 데이터셋Hugging Face2.6MBCC BY-NC 4.0조건부 가능
KorWikiTableQuestions한국어 QA 데이터셋GitHub70K 표 QACC BY-SA 4.0가능
KoSBi 한국어 편향성 완화 데이터셋한국어 NLP 데이터셋GitHub대용량MIT가능
KoSEnd 한국어 어휘론적 함의(Entailment) 데이터셋한국어 NLP 데이터셋GitHub6.2MBApache 2.0가능
KoSimpleQA 한국어 사실성 QA한국어 QA 데이터셋Hugging Face301KB원본 확인조건부 가능
KoSum 한국어 유튜브 멀티모달 요약 데이터셋한국어 음성 데이터셋Hugging Face (iontail)45GBCC BY-NC 4.0가능
KOTE 한국어 온라인 댓글 감정 데이터셋한국어 감성분석 데이터셋Hugging Face (searle-j)중용량MIT가능
KPoEM 한국어 고전 시 문학 정서 주석 데이터셋한국어 감성분석 데이터셋GitHub4.2MBMIT가능
KRETA (Korean Rich Text Visual QA)한국어 OCR 데이터셋Hugging Face125MB원본 확인가능
KREW 한국어 페르소나 역할극(Role-Playing) 데이터셋한국어 지시문 학습 데이터셋Hugging Face (huggingface-KREW)28MBApache 2.0가능
KsponSpeech (대규모 자유발화)한국어 자유발화 음성인식AI Hub1000시간AI Hub 이용안내조건부 가능
KSS Dataset (성우 음성 합성)한국어 TTS 데이터셋Hugging Face12시간+CC BY-NC-SA 4.0불가
KULLM-v2 (한국어 지시문)한국어 지시문 학습 데이터셋Hugging Face180MBApache 2.0가능
LIMA 한국어 고품질 극소정예 데이터셋한국어 지시문 학습 데이터셋Hugging Face소용량CC BY-NC-SA 4.0가능
MeloTTS 한국어 실시간 음성합성 데이터셋한국어 TTS 데이터셋Hugging Face중용량MIT가능
OLKAVS 한국어 시청각 음성한국어 음성인식 데이터셋GitHub1,150시간 오디오원본 확인조건부 가능
Open Subtitles (ko-en) (자막 번역)한국어 번역 데이터셋GitHub대용량원본 확인가능
OpenAssistant Guanaco 한국어한국어 지시문 학습 데이터셋Hugging Face16.7MBApache 2.0가능
OpenOrca-KO한국어 지시문 학습 데이터셋Hugging Face21.8MBMIT가능
Orca 한국어 DPO 선호도 데이터셋한국어 NLP 데이터셋Hugging Face중용량Apache 2.0가능
Pansori TEDxKR 음성 코퍼스한국어 음성인식 데이터셋GitHub약 3시간CC BY-NC-ND 4.0조건부 가능
ParaKQC 한국어 질문·명령 병렬한국어 NLP 데이터셋GitHub10,000 발화 (v1)CC BY-SA 4.0가능
PAWS-X (ko) (문장 유사성 분류)한국어 NLP 데이터셋GitHub5.1MBOther조건부 가능
QARV 한국어 인스트럭션 데이터셋한국어 지시문 학습 데이터셋Hugging Face중용량MIT가능
skt/KVQA (시각장애 보조)한국어 비전 데이터셋Hugging Face100,445개 페어Korean VQA License불가
SmileStyle 한국어 다채로운 문체 변환 코퍼스한국어 사전학습 코퍼스GitHub (smilegate-ai)35MBMIT가능
SNS 소셜 대화 정제 데이터셋한국어 대화 데이터셋AI Hub980MBAI Hub 이용안내조건부 가능
SNU Ko-MuSR 한국어 다단계 추론 데이터셋한국어 LLM 벤치마크Hugging Face (thunder-research-group)소용량MIT가능
Speech Emotion Dataset (ko)한국어 음성 데이터셋GitHub3.2GB원본 확인가능
SQuARe 한국어 민감 주제 안전성 데이터셋한국어 NLP 데이터셋GitHub중용량MIT가능
Table-VQA-ko (스캔문서 표 판독)한국어 OCR 데이터셋Hugging Face185MBApache 2.0가능
Tatoeba (ko-en)한국어 번역 데이터셋GitHub3.4MBCC BY 2.0가능