교과서 기반 에듀케이션 한국어 말뭉치
초중고 주요 교과과정 서적과 학습 보조 교재의 핵심 내용을 LLM 학습에 용이하도록 질의응답 및 설명글 형태로 재구성하여 분류한 데이터셋입니다.
KoBEST, 영수증 OCR, TTS, 지시문 학습까지 — 언어·라이선스·형식으로 찾고 원본 제공처로 이동합니다.
GearDel은 한국어 NLP·음성·비전 탐색 카탈로그입니다. 파일은 호스팅하지 않습니다.
Korean AI datasets from AI Hub, Hugging Face, GitHub, and NIKL—compare source, license, and size. GearDel does not host files.
Showing 243 of 243
Verification badges show catalog status per field — not every dataset is fully verified.
초중고 주요 교과과정 서적과 학습 보조 교재의 핵심 내용을 LLM 학습에 용이하도록 질의응답 및 설명글 형태로 재구성하여 분류한 데이터셋입니다.
인공지능 모델이 고객 리뷰의 어조를 정밀 분석할 수 있도록, 다양한 카테고리의 실제 네이버 쇼핑 평점(1~5점) 기반 긍·부정 텍스트 데이터셋입니다.
동일한 정보나 내용을 고전 시가풍, 비즈니스 이메일 톤, 일상 대화체, 문학 소설 등 여러 가지 문체(Writing Style)로 다채롭게 변환할 수 있도록 구축된 합성 데이터셋입니다.
한국어 텍스트 문맥 속에 모호하게 삽입된 대명사(그것, 그, 그녀 등)가 앞서 언급된 명사 중 물리적/사회적 상식 법칙에 의거하여 어떤 대상을 가리키는지 논리 판단을 검증하는 벤치마크입니다.
한국어의 특유 부정 표지('안', '못', '-지 않-', '-지 못하-', '말다')가 포함된 문장에서 대형 언어 모델이 부정의 맥락을 얼마나 올바르게 인지하는지 문장 수준으로 평가하는 벤치마크입니다.
한국어 챗봇 개발의 고전적이고 대표적인 오픈소스 자원으로, 일상다반사와 사랑, 이별 등 섬세한 감정 상태에 맞는 카운셀링 및 대화 데이터로 이뤄져 있습니다.
외국 수능 지문 분석 모델을 평가하기 위해, 영어 수능 모의고사 및 본수능 문항들의 난해한 영어 구조를 지극히 한국어 맥락에 맞도록 정밀 정합하고 직역 및 의역 해설을 수록한 고난도 번역 코퍼스입니다.
건전한 소셜 인공지능 윤리를 수립하기 위해 여성/가족, 성소수자, 인종/국적, 연령 등 총 10가지 차원의 악성 혐오 표현 여부를 레이블링한 데이터셋입니다.
게임 플랫폼 스팀(Steam)의 한국어 유저 리뷰를 기반으로 유용함 및 추천 여부(긍정 1, 부정 0)를 가공하여 구성한 서브컬처/구어체 특화 분류 데이터셋입니다.
엔비디아(Nvidia)의 주도로 구축된 소버린 AI(Sovereign AI) 및 가상 데이터 증강용 데이터셋으로, 한국의 실제 다양한 연령, 성별, 직업별 사회문화적 성향을 다각도로 모사하는 가상 페르소나 인스트럭션 데이터셋입니다.
HuggingFace의 대표 교육용 데이터셋인 FineWeb-Edu의 정제 규칙을 벤치마킹하여 고품질 한국어 웹 자료만을 엄선해 구성한 고정제 사전학습 데이터셋입니다.
인터넷에 공개된 양질의 한국어 SFT(Supervised Fine-Tuning)용 질문-대답 데이터들을 표준 포맷으로 통합 수집한 데이터셋입니다.
국민청원 게시판에 게재되었던 청원 내용을 정제하여 자연어 처리 모델의 요약, 분류, 감성 분석 학습을 돕는 데이터셋입니다.
미국 스탠포드대학의 SNLI 및 MultiNLI 데이터를 한국어 정서에 부합하도록 전문 번역 및 검수를 진행한 한국어 대표 자연어 추론(NLI) 데이터셋입니다.
다양한 분야의 문장 쌍에 대해 미세한 의미 차이(Similarity)를 0점에서 5점까지 점수화하여 다면적인 문장 표상 임베딩 성능을 평가하는 데이터셋입니다.
챗봇이 다자간 대화나 긴 맥락의 대화 도중 일부러 오답을 유도하는 꼬임성(Adversarial) 질문에 넘어가지 않도록 정밀 대응력을 테스트하는 데이터셋입니다.
일반 상식과 일상적인 대화, 간단한 코딩 및 문서 수정 등 일상 비서 에이전트 성능을 보정하기 위한 고품질 데이터셋입니다.
한국의 독특한 사회적 분위기, 관습, 예절 등 문화적 맥락을 LLM이 제대로 인지하고 있는지 현실적인 시나리오로 평가하는 벤치마크 데이터셋입니다.
2025년 한국 정계 개편 및 지지율 추이에 관한 국내 주요 언론 사설, 온라인 포럼 의견, 대중 여론조사 예측 결과의 미묘한 시각 차이와 극성을 수집 분석한 선거 오피니언 아카이브입니다.
웹의 방대한 데이터 중 교육적 가치(Educational Score)가 높은 고품질 텍스트만 머신러닝 분류기로 판별하여 선별한 사전학습용 말뭉치입니다.
부동산, 주식 시장, 기초 거시 경제 용어 등 금융 비즈니스 전문 도메인 질문과 답변을 정밀 학습하기 위한 Alpaca 스타일의 데이터셋입니다.
간단한 사실 매칭을 넘어, 참/거짓 판단을 유도하기 위해 다단계의 배경 지식 추론(Multi-hop Reasoning) 과정을 거치는 추론 검증 데이터셋입니다.
한국어 Foundation Model 학습을 위해 한국어 위키피디아 덤프 및 공개 데이터를 결합하여 정제 및 토큰화한 필수 코퍼스 데이터입니다.
기업 및 스타트업이 라이선스 제약 없이 완전한 상업용 제품 개발에 투입할 수 있도록 MIT 라이선스로 선배포된 전천후 지시어 데이터셋입니다.
수학적 지능(Mathematical Reasoning)을 기르기 위해, 복잡한 실생활 서사형 질문에서 추론하여 직접 논리적 수식을 세우고 풀이하는 코퍼스입니다.
인터넷 주요 커뮤니티의 다양한 댓글을 전처리하여 욕설, 공격성, 인신공격 여부를 이진 분류용으로 수동 라벨링한 인공지능 윤리 가드레일 데이터셋입니다.
한국어 위키백과 정기 덤프 파일에서 마크다운 및 불필요한 문장 부호들을 완전 제거하고, 어휘 구조가 바른 순수 자연어 문장으로 필터링한 학습용 기본 코퍼스입니다.
멀티모달 Vision-Language 모델(VLM) 학습을 위해 사물, 인물, 배경이 혼재된 복잡한 이미지의 시각 정보를 한국어로 정밀 묘사해 놓은 데이터셋입니다.
기본적인 교양 과학, 역사, 문학 등 지식 습득 능력을 극대화하기 위해 초·중·고교 교육과정 수준의 지식 구조를 인공 합성하여 전처리한 텍스트 말뭉치입니다.
인공지능 대화형 에이전트가 지나치게 딱딱한 어조를 탈피하고, 일반 사용자처럼 친근한 구어체 및 대화의 맥락(Context)을 이해할 수 있도록 설계된 데이터셋입니다.
인공지능 에이전트가 외부 API나 DB 함수를 호출하는 능력(Tool Use / Function Calling)을 기를 수 있도록 대화 흐름을 한국어화한 데이터셋입니다.
국내 온라인 포털 뉴스의 댓글 자원을 고정밀 분석하여 혐오 및 성희롱 편향을 수작업 감수한 리소스입니다.
전화 통화 환경에서 발생하는 하드웨어 통화 채널 노이즈와 목적 대화를 정밀하게 담아낸 데이터입니다.
카카오브레인이 글로벌 학술용으로 공개한 7억 장 규모의 초대형 웹 alt-text 이미지-텍스트 얼라인먼트입니다.
2025학년도 대학수학능력시험 국어 영역(비문학, 문학, 화법과 작문, 언어와 매체) 전체 지문과 객관식 문항을 LLM의 종합 독해 및 논리 도메인 지식 성능 평가용으로 수록한 고도화된 시험 벤치마크입니다.
금전 갈취, 신체적 무력 협박, 심리적 가스라이팅 지배 대화를 차단하기 위한 분류 주석 데이터입니다.
법률 해석과 근거 인용을 위한 한국어 instruction-tuning 데이터셋입니다.
단순한 욕설 차원을 넘어 성별, 종교, 연령, 지역 등 현대 사회의 미묘하고 비정형적인 혐오 카테고리를 세분화하여 탐지하는 가드레일 데이터셋입니다.
인공지능 웹 에이전트 모델이 한국의 사회 문화적 맥락(쇼핑, 행정, 뷰티 등)이 담긴 실제 한국어 웹사이트들을 복합적으로 탐색하고 정답을 정확하게 가져오는지 수동 검증하기 위해 구축된 에이전트 평가셋입니다.
한국어 언어 이해를 평가하는 8개 과제(분류·NER·관계 추출·QA 등) 벤치마크입니다.
인문·사회부터 STEM까지 45개 분야의 한국어 객관식 LLM 평가 데이터셋입니다.
공인노무사, 변리사, 회계사, 세무사, 한의사, 치과의사 등 한국의 전문직 자격시험 및 학술 문항들을 수집하여 LLM의 고도화된 한국어 논리 및 지식 추론 능력을 평가하는 최신 벤치마크 데이터셋입니다.
네이버 지식인 정제 데이터 기반의 실생활 맥락 및 가이드라인 학습용 지시어 데이터셋입니다.
한국어 ELECTRA 모델 학습 및 어휘 사전(Vocabulary) 구성을 위해 나무위키, 위키백과, 뉴스 기사 등을 골고루 배합하고 신뢰성 높은 토큰들만 정밀 샘플링한 데이터셋입니다.
한국어가 모국어가 아닌 외국인 화자(미국, 중국, 베트남 등)가 발화한 한국어 녹음 자료를 바탕으로 악센트 및 잘못된 발음 형태를 ASR이 올바르게 보정 인식하게 돕는 ASR 벤치마크입니다.
한국의 유명 연예인, 셀러브리티, K-POP 아이돌, 인플루언서의 실제 무대 역광 조명, 복잡한 군중 전경, SNS 일상 전경 등 비정형적이고 역동적인 환경에서의 이미지와 인물 라벨 정보를 결합한 컴퓨터 비전 데이터셋입니다.
한국어 대형 언어 모델(LLM)이 사람이 내린 다양한 제약 조건과 복잡한 지시 사항을 얼마나 정확히 이행하는지 평가하기 위한 벤치마크 데이터셋입니다.
고도화된 코딩, 복잡한 논리 추론, 시스템 프롬프트 이행 등을 완수할 수 있도록 해외 우수 자원인 OpenHermes를 한국어로 번역 및 조정한 고품질 데이터셋입니다.
한국의 대학수학능력시험(수능) 및 평가원 모의고사 수학 4점짜리 고난도 기하, 미적분, 확률과 통계 문항의 수식 및 정밀 풀이 단계를 정형 수록한 AI 수리 추론 벤치마크입니다.
한국의 전국 명소, 맛집, 전통 한옥 등 실제 여행 소셜 이미지를 바탕으로 주석한 풍경 태그 데이터셋입니다.
실제 한국 도시 한복판의 야외 교통 표지판, 광고물, 세로형 식당 간판 등의 자연 전경 글자 해독 데이터셋입니다.
한국 사회 내에 존재하는 나이, 성별, 직업 등에 대한 고정관념이나 차별적인 왜곡 문장을 정중하고 건전한 문장으로 대체한 완화 데이터셋입니다.
2024년에서 2026년 사이에 업로드된 인기 한국어 유튜브 비디오 700개를 활용하여, 영상 시각 정보, 오디오 파형, 자막 텍스트 특징을 모두 결합한 한국어 멀티모달 비디오 요약 및 하이라이트 감지용 데이터셋입니다.
가상의 성격, 연령, 구체적인 직업군 또는 역사적 인물 페르소나를 모델에 이식하고, 해당 캐릭터 설정과 고유한 어투를 끝까지 유지하며 자연스럽게 대화를 이어가도록 설계된 SFT 데이터셋입니다.
대한민국 공식 표준 1,000시간 분량의 자유 발화 정합 및 자소 단위 표기 학습용 음성 표준 데이터셋입니다.
GPT4ALL, Dolly, Vicuna 데이터를 한국어로 번역한 지시문 학습 데이터셋입니다.
적은 부피로도 뛰어난 성능 향상을 꾀할 수 있도록 고품질의 영어 LIMA 가이드라인을 완전 한국어 정서에 맞춰 재번역 및 수정한 데이터셋입니다.
고성능 하드웨어뿐만 아니라 CPU급 로컬 기기에서도 빠르게 대화체를 음성 합성할 수 있도록 전처리된 고품질 TTS 매칭 데이터셋입니다.
인간 피드백 반영 모델 정렬(Alignment)을 위한 DPO(Direct Preference Optimization) 학습용 한국어 선호도(Preferred/Rejected) 데이터셋입니다.
적대적으로 교묘히 배치된 다국어 유사 뉘앙스 문장 속에서 미세 의미 일치 여부를 파악하는 한국어 파트셋입니다.
해래(HAE-RAE) 허브에서 구축한 지시어 학습 데이터셋으로, 한국어 상식과 자연어 이해력을 강화하기 위한 고품질 SFT 데이터입니다.
시각장애인이 모바일 카메라로 직접 실물 객체를 촬영한 사진과 이에 대해 물어본 실제 한국어 질문 및 검수 답변셋입니다.
스마일게이트 AI 팀이 한국어 문체 다양성 연구를 위해 공개한 데이터셋으로, 일상적인 베이스 대화를 정중체, 격식체, 아재체, 소설체 등 총 10가지 이상의 컨셉과 말투로 일치시킨 대규모 어미 변환 병렬 데이터셋입니다.
서울대학교 연구팀에서 제작한 데이터셋으로, 살인 사건 수사, 물건 배치, 팀 배정 등 긴 문맥 속에서 여러 단계의 논리적 단서를 조합해야 풀 수 있는 고난도 추론 데이터셋입니다.
AI가 정치, 젠더, 종교 등 편파적이기 쉬운 민감 주제에 대해 중립적이고 안전하게 우회하여 대답할 수 있도록 훈련하는 가드레일 데이터셋입니다.
어린이용 짧은 영어 동화 모음인 TinyStories를 한국어로 정밀 번역하고 정제한 초경량 언어 모델 사전학습 및 지시어 학습용 데이터셋입니다.
구글이 설계한 11개 복합 문자 체계 중 한글 위키백과 기반의 정합 질의응답 지식 모델용 데이터셋입니다.
저자원 언어 및 한국어 Foundation Model의 사전학습 성능을 상향 평준화하기 위해 수집된 대규모 텍스트 데이터셋으로, 정밀 휴리스틱 및 인공지능 클린 필터링 공정을 통과한 고신뢰도 웹 말뭉치입니다.
국내 대표 음성인식(ASR) 프레임워크인 Kaldi의 빌드를 지원하고, 자유로운 비즈니스 음성 합성을 촉진하기 위해 배포된 대규모 음성 전사 데이터셋입니다.
문체 및 공적 어법 준수, 시사 지식 확충을 위한 대한민국 최대의 정제 신문 말뭉치 자원입니다.
현실 실생활 줄임말, 자음 위주의 구어 표현을 구조적으로 학습하기 위한 모바일 메신저 전사 말뭉치입니다.
대화 원문과 한 문장 요약문으로 구성된 한국어 대화 요약 학습 데이터입니다.
한국어 기계 독해(MRC) 연구를 위한 Wikipedia 기반의 대규모 질의응답 데이터셋으로, 문맥을 읽고 질문의 답을 본문에서 정확히 찾아내는 모델을 만듭니다.
한국의 고유 풍습, 명절, 일상 행정 규율 등을 LLM이 얼마나 정확하게 아는지 검정하는 시험 데이터셋입니다.
초등 수학 문장형 문제를 해결하기 위한 GSM8K 데이터셋의 한국어 정밀 번역 코퍼스입니다.
신문 헤드라인을 보고 정치, 경제, 사회, 생활문화, IT과학, 세계 등 어느 뉴스 주제에 해당하는지 정확히 분류해 내는 다중 클래스 분류 데이터셋입니다.
문장 속에 등장하는 두 개체(주체와 대상) 간의 시맨틱적 관계(예: 부모 자식 관계, 소속 기관 관계 등)를 규명하는 자연어 정보 추출 데이터셋입니다.
질문의 유형을 단순 사실 확인형뿐만 아니라 추론형, 부정형(질문에 대한 답이 본문에 없는 경우)까지 확장하여 모델의 독해력을 정교하게 판단하는 MRC 데이터셋입니다.
서로 다른 문장 두 개가 의미상으로 얼마나 유사한지를 0점에서 5점 사이의 실수값으로 세밀하게 채점해 둔 시맨틱 문장 유사도(Semantic Textual Similarity) 데이터셋입니다.
두 문장(전제와 가설) 사이의 논리적 관계가 참(Entailment), 모순(Contradiction), 중립(Neutral) 중 어느 것에 부합하는지 가려내는 고급 한국어 추론용 벤치마크입니다.
한국어 LLM의 상식 추론, 인과 관계 판단 등을 다차원 검정하기 위해 특별 제작된 데이터셋입니다.
카드 영수증, 간이 영수증 내부의 매장명, 일시, 부가세액, 품목 리스트를 구조화하여 추출하는 정산용 데이터셋입니다.
포스터, 표식, 복잡한 실외 간판 레이아웃 내부의 디자인 텍스트를 기민하게 해독하는 이미지 데이터입니다.
전문 여성 성우의 맑은 낭독음과 정확한 발음 정렬로 유명한 베스트셀러 음성 합성(TTS) 데이터셋입니다.
실제 영화, 해외 드라마 자막 대사 데이터로 이루어져 인물 간 핑퐁 대화 구어체 학습에 안성맞춤인 대형 한영 병렬셋입니다.
표준 문장 뒤에 숨겨진 인간의 분노, 짜증, 설렘 등 미묘한 감정 극성을 탐색하여 레이블링한 음성 분류셋입니다.
스캔 문서 내부의 복잡한 그리드 격자 수치와 정산 수치를 정확하게 산출하는 표 판독 전용 시각 QA 데이터입니다.
전 세계 다국어 사용 자발적 참여 집단지성 번역 프로젝트 기반의 일상 표현 위주 정합 한영 병렬 자원입니다.
초기 진압 드론의 산불 오탐 방지를 위해 구름과 연기, 안개를 예리하게 구분 정합한 훈련 이미지입니다.
현장 CCTV 속 안전모 미착용자, 턱끈 불량자를 신속히 가려내 경고해 주는 AI 탐지용 이미지셋입니다.
현업 통화 녹음 자료에서 유해한 신상을 완전히 제거하고, 상담 대화를 텍스트와 정합한 ASR 리소스입니다.
국정 자료, 보도자료 등 행정 문서 속에서 정확한 지식 정답 위치를 검출하는 MRC 데이터셋입니다.
각 부처에서 정기 발행하는 주요 정책 보고서와 실증 자료를 일목요연하게 텍스트 요약한 리소스입니다.
국내 아파트, 상가, 오피스텔 분양 및 매매 카탈로그 상의 설명 정보를 정형 임베딩하기 위한 데이터입니다.
산업 기계 노후화에 따라 변형되는 비정상 미세 마찰음을 소리로 자동 검사하는 AI 솔루션 훈련셋입니다.
한국 가옥의 공간 구조와 홈 스타일링 메디컬 배치를 3D 평면 맵과 가구 사진으로 기록한 자원입니다.
애니메이션 자동 채색 봇 학습을 위한 웹툰 작화 얼굴, 머리 스타일 바운딩 태그 데이터셋입니다.
정비 주기, 대시보드 경고등 의미, 조작 매뉴얼 텍스트를 인공지능이 즉시 검색 답변토록 정합한 데이터입니다.
원격 사물인터넷, 반도체 적외선 노광 특허를 글로벌 규격 문체에 정형화한 번역 훈련셋입니다.
작물 재배법, 제철 원예 방제, 농업 보조금 신청 절차를 총체적으로 매핑한 원스톱 Q&A 텍스트입니다.
기업 공시, 증권사 리포트 등 까다로운 도표 지표 정보를 포함한 전문 기계독해 학습 데이터셋입니다.
경제 속보의 뉘앙스를 '호재', '악재', '중립'으로 주석하여 주가 분석 모델을 훈련하는 사전식 텍스트입니다.
한국어 자연어 처리 연구에서 가장 널리 쓰이는 기본 데이터셋으로, 영화 포털 사이트의 140자 평점을 긍정(1)과 부정(0)으로 분류해 둔 감성 텍스트 데이터셋입니다.
2018년에 개최된 챌린지에서 공개된 데이터로, 텍스트 안에 내포된 각종 특수 태그(기관, 고유명사, 지명 등)들을 정밀 식별해 둔 대표 개체명 인식 데이터셋입니다.
안전 등급 진단을 위해 국내 고가 차도 터널 천장의 미세 콘크리트 균열 사진과 크랙 치수 데이터입니다.
정치, 사회, IT 등 분야별 신문 기사를 세 문장 이하로 요약 정렬한 데이터셋입니다.
정확한 딕션과 정형적인 호흡을 준수하는 낭독 녹음물로 고품질 TTS 성우 베이스로 많이 기용됩니다.
국내 체류 다문화 가정을 위한 관공서 양식, 보건 안내문 한글-베트남어 수동 번역 데이터셋입니다.
서로 다른 성별, 연령대의 일반인 화자 200명이 일정한 스크립트를 깔끔히 낭독한 합성 훈련용 리소스입니다.
칠판 판서 중 나오는 목소리 울림, 전문 공학 용어 구어 발화를 인공 인식하게 하는 고난도 데이터셋입니다.
유통 매장에서 자주 접수되는 환불, 배송, 상품 교환 관련 업무 매뉴얼 및 가상의 질문/답변 셋입니다.
자율 주행 발레 파킹 로봇의 충돌 방지를 위해 설계된 실내 로우 라이트 주차 구역 이미지셋입니다.
국내 교차로, 어린이 보호 구역을 주행하며 촬영한 다각도 블랙박스 전경 및 장애물 3D 입체 좌표 세트입니다.
차량 경적소리, 사이렌, 공사장 소음, 발걸음 등을 정형 수집하여 마이크 이상 감지를 학습합니다.
정형 극본 속 대화 구조, 감정 연출 지시어, 인물 성격 지정을 이해하도록 튜닝하는 데이터셋입니다.
방송 프로그램, 일상 토론 등 실제 발화된 구어 텍스트를 고화질 전사 처리한 데이터셋입니다.
저작권 협의가 완료된 현대 도서 텍스트 본문 문장 데이터로, 문어체 표준 문맥 학습에 용이합니다.
X(트위터), 인스타그램 등 공공 소셜 미디어 피드를 기반으로 구축된 최신 유행어 및 구어체 데이터셋입니다.
블로그, 커뮤니티 등 인터넷 상의 다양한 웹 텍스트 자료를 정제하여 수집한 말뭉치입니다.
다양한 주제에 대한 일반 대중의 일상 대화를 정제한 말뭉치 데이터셋입니다.
게임 약관, 무기 아이템 설명서, 인게임 퀘스트 완료 조건을 즉시 질의 가능한 기계독해 코퍼스입니다.
택배 상자 구겨진 바코드, 훼손된 송장 내부의 한국 주소 영문 수하물 정보를 추출하는 리소스입니다.
개와 고양이의 고통, 불안, 행복, 요구 소리를 마이크로 확보해 동물 의사소통 AI를 훈련합니다.
수의사 협진을 통해 수집한 반려견/반려묘 피부 발진, 백내장 등 초진 안심 촬영 이미지입니다.
실제 의료 정보를 대체하여 비식별 합성 생성한 인공 의학 상담 및 진단서 텍스트 데이터셋입니다.
벼나 배추 잎사귀 표면에 핀 갈색 점 무늬병 등 해충 손상 잎사귀 병리학 이미지 데이터셋입니다.
자동차, 조선, 의료, 항공 등 10대 전략 산업 전문 논문 및 기술 가이드 문서 통합 사전학습 데이터셋입니다.
상속세, 연말정산, 생활 분쟁 조율 등 시민 밀착형 법적 질의사항에 대한 전문가의 모범 답변 텍스트입니다.
드론 상공 비행을 통해 해수욕장 모래사장에 파묻힌 폐어구, 쓰레기를 식별 진단하는 시각 데이터셋입니다.
요식업, 소매업 등 오프라인 소상공인들이 접수받은 현실적 Q&A를 카테고리별 정형화한 데이터셋입니다.
인스타그램, 엑스(X), 유튜브 등 글로벌 사회관계망서비스(SNS)에서 포착되는 신종 비하 단어, 문맥 왜곡형 인격 모독 문장들을 실시간성 높게 수집해 정제한 필터링용 데이터셋입니다.
젊은 세대 팬덤 비즈니스를 겨냥한 대화체 챗봇을 학습시키기 위해 구축한 역동적 감성 텍스트입니다.
발음이 불완전한 5~13세 아동의 목소리를 정교하게 인식하기 위해 특별 학습된 ASR용 데이터입니다.
보안이 중요한 구역이나 스마트 안경에 작게 귀속말로 발화된 특수한 속삭임 신호를 인식하는 리소스입니다.
단순히 물건이 좋다 나쁘다가 아니라 '배송', '성능', '디자인', '가격' 등 소비자가 후기에서 거론하는 여러 특성(Aspect)별 속성 평점을 세분화한 데이터셋입니다.
'불 꺼줘', '채널 올려줘'와 같은 짧고 직관적인 IoT 작동 원격 제어 발화셋입니다.
친근하고 상호작용력이 극대화된 AI 대화형 비서용 성우 감정별 오디오 리소스입니다.
축구, 야구 등 동적인 경기 상황 캐스터들의 가속되고 격앙된 빠른 구어 음성 자소 전사셋입니다.
목소리가 다소 잠기거나 발화 속도가 느린 65세 이상 노년층의 음성 인식을 지원하는 오디오 데이터셋입니다.
외국인 학습자나 번역 AI가 오역하기 쉬운 실생활 비유어(예: '발이 넓다', '바가지를 씌우다')를 문맥 내에서 올바르게 이해하고 번역하도록 정립한 코퍼스입니다.
금융 사기 수사에서 추출한 사기범 통화 패턴을 모아, 금융사기 원스톱 사전 예방 봇을 훈련시키는 소중한 음성입니다.
실제 의료용 고정밀 청진기로 청각 수집한 심잡음 및 폐 염증 오디오와 전문의 라벨링 데이터셋입니다.
드론 침입을 소리로만 예리하게 탐지하도록 주변 드론 로터 소리와 생활 백색 소음을 융합한 오디오셋입니다.
고정밀 암 세포 현미경 슬라이드와 형태학적 세포 이상 여부를 표시한 산부인과 정형 암 검진 데이터입니다.
기업 M&A 시 수반되는 최고 부하의 영문 계약 조약 및 한글 법리 대칭 전문 병렬셋입니다.
소설의 인물별 성격 묘사, 감정이 충만한 낭독 오디오와 오디오북 챕터별 대칭 텍스트 자원입니다.
인터넷 신문 및 심층 기획 보도 기사를 고품질 맞춤법 필터링 후 가공한 대형 사전학습 텍스트입니다.
정밀 라이다 및 드론으로 스캔한 한국 불교 미술탑, 가옥 서까래 고해상도 점구름 및 3D 메타데이터입니다.
재활용 컨베이어 벨트에 투하된 플라스틱, 캔, 라벨 유무 여부를 지각하는 이미지 데이터셋입니다.
전형적인 문어가 아닌 1020 신조어, 리얼 줄임말 감정이 담긴 오리지널 유행 번역 데이터셋입니다.
화학 의약 명칭, 금기 효능 설명서의 어투를 완벽히 통제하여 정형화한 한영 제약 번역 리소스입니다.
주요 패션, 전자기기 카테고리 상품의 명세서 정보를 기반으로 인공 카피를 자동 생성하는 데이터셋입니다.
일반 문학/학술 도서의 텍스트 주요 요점을 추출하여 추상 요약 모델 학습용으로 주석한 리소스입니다.
N타워, 제2롯데, 광화문 등 대표 지리학적 구조물 사진과 GPS, 텍스트 상세 명세 매핑 리소스입니다.
하이테크 디바이스 특허의 청구 단락 및 도면 설명의 상세 핵심 원리를 정제한 텍스트 코퍼스입니다.
공학, 의학, 사회과학 등 전문 학술 도서의 고부하 단락을 전문 요약가가 직접 정제한 학습 데이터셋입니다.
가야금, 거문고, 대금 등 전통 국악기 개별 음정 사운드를 고음질 채널로 추출하여 국악 AI 정합에 활용합니다.
의원 발화, 배석자 발언 등 동시 다발적 핑퐁이 있는 회의록 오디오 및 발언자 자동 레이블링 셋입니다.
우울증, 심리상담 가이드 등 웰니스 분야에 대한 전문가 검수 Q&A 매칭 텍스트 데이터셋입니다.
한국 전통 한문 원서의 구절을 현대적이고 유려한 표준 한국어 문맥으로 일대일 정렬한 대칭셋입니다.
대한민국의 주요 정치 논점 및 북한 안보 동향 보도 기사의 신문 정제 한영 대칭 말뭉치입니다.
생산 공정 불량 원인 분석, 경영 안정 지원 신청 등에 관한 현실 해결책 매칭 텍스트입니다.
전국 5개 도의 사투리를 생생하게 담은 녹음 음성 데이터와 자막 전사 파일 세트입니다.
경상, 전라, 충청, 강원, 제주 방언의 구어체를 정밀하게 표준어 본문과 병렬 구성한 데이터셋입니다.
전국 대표 자연 명소, 맛집 투어 정보를 SNS 마케팅에 요긴한 핵심 3선으로 가공한 데이터셋입니다.
엔진 구동 및 타이어 마찰 소음이 가득한 주행 환경 속 내비게이션 조작 음성 주석 데이터입니다.
국어 교과서, 청소년 추천 도서에서 수집한 이해도 평가용 교육용 지문 및 문항 데이터셋입니다.
전화 상담에서 도출된 이질적인 상담 이력을 유형별로 완벽 자동 분류 및 텍스트 요약한 데이터셋입니다.
복잡한 특허 기술 설명서로부터 청구 범위 및 핵심 원리를 자동 질문 답변화한 리소스입니다.
대법원 판례 및 하급심 판결서 원문을 인공지능 의미 검색에 적합하도록 정형화한 데이터셋입니다.
피부 임상 접사 사진을 수확하고 전문의가 염증 지수를 중증도 단계별로 세심 주석한 헬스케어 리소스입니다.
서버 구축, 데이터베이스 매뉴얼, API 가이드라인의 특수 엔지니어링 용어 한영 매칭 말뭉치입니다.
일본인 관광객을 위한 쇼핑 메뉴, 맛집 소개, 지리 안내를 한-일 대칭 정렬한 구어 리소스입니다.
특허 계약, 무역 조항, 법인 인가 서류의 난해한 조항을 대칭 정합한 한-중 전문 번역 데이터입니다.
실제 간판의 기괴하거나 필기체에 가까운 폰트 변주를 인식하기 위해 수집한 한국 지리학적 OCR 데이터입니다.
한국의 대표 시인들의 퍼블릭 도메인 및 오픈소스 대상 시 작품을 정제하여, 인공지능이 문학적인 비유와 리듬감을 학습하고 창작할 수 있게 돕는 아카이브입니다.
제주도, 경상도, 전라도 등 고유한 억양과 고유 어휘를 사용하는 지방 방언 음성을 녹음하여 이에 대응하는 현대 표준 한글 자막과 대칭화한 전사 데이터셋입니다.
가요, 발라드 트랙 속 반주 사운드와 리얼 싱어 보컬 오디오를 멀티트랙 분리 추출한 오디오셋입니다.
청각장애인을 위한 수어 모션을 비디오 프레임으로 기록하고, 매칭되는 한국어 자막을 텍스트화한 셋입니다.
다채로운 한식 요리들의 정량적인 식재료 구성과 1단계부터 마지막 조리까지의 흐름을 가독성 높게 규정화한 레시피 아카이브 데이터셋입니다.
기계 기계 번역 및 정밀 크로스보더 데이터 인덱싱을 지원하도록 설계된 과학, 물리, 화학 등 지식재산 특허청 명세서의 한-영 정렬 병렬 코퍼스입니다.
슬픔, 기쁨, 분노, 당황, 상처, 불안, 중립의 7가지 감정을 인지하고 표현할 수 있도록, 연기 전문가들이 일상 대본을 기반으로 다른 톤으로 연기한 감정 가공 음향 아카이브입니다.
경제 및 금융 기사 제목과 본문 요약을 바탕으로, 해당 이벤트가 특정 주가나 시장 경제에 긍정(Bullish), 부정(Bearish), 혹은 중립(Neutral) 영향을 미치는지 분별하기 위해 고안되었습니다.
수동 전처리 오차율을 극도로 줄여 AI 모델의 정밀 성능 검증용(Test Set)으로 사용할 수 있게 고안된 가장 공신력 높은 한국어 NER 골드 데이터셋입니다.
개인 인적 사항과 민감 인공 정보를 완전 마스킹(De-identification) 처리한 뒤, 임상 및 간호 일지 속의 주요 전문 임상 어휘를 토큰화하고 계통별로 맵핑한 전문 의학 정보 데이터셋입니다.
불법 도박, 허위 광고, 금융 사기(피싱) 등 일상적으로 유포되는 불량 SMS/MMS 문자를 수집하여 정상(Ham)과 악성 스팸(Spam)으로 이진화한 데이터셋입니다.
위키피디아 전체 문서를 대상으로 HTML 표(Table)나 복잡한 서식을 해석하고 구조화된 장문 속에서 정보를 탐색해 내는 고차원 엔지니어링용 독해 데이터셋입니다.
동일한 전달 문장을 평어(반말), 극존칭, 문어체, 해요체, 인터넷 유행어 등 수용하는 상황과 대화 상대에 어울리는 최적의 말투로 유기적 변환을 돕는 패러프레이즈 데이터셋입니다.
한국어 조사 사용 오류('은/는', '이/가'), 주어-서술어 호응 불일치, 불완전한 문장 구조 등의 비문(Grammar Error)을 판별하고 정합된 정문으로 도출하기 위한 문법 교육용 교퍼스입니다.
텍스트 표면적으로는 긍정형 단어를 사용하나 실제로는 부정적인 비꼼이나 조롱을 조형하는 반어법(Sarcasm)을 모델이 가려낼 수 있도록 라벨링한 정교한 데이터셋입니다.
칼럼이나 설득문 논설 텍스트 속에서 필자가 내세우는 핵심 주장(Claim)과 이를 뒷받침하는 구체적인 객관적 근거(Premise)의 인과 관계 구조를 추적하는 마이닝 데이터셋입니다.
학술 연구나 교과 지식 외에, 일반인이라면 인지해야 하는 직관적이고 사소한 기초 생활 상식을 바탕으로 다지선다 보기 중 합리적인 정답을 논리적으로 고르는 벤치마크입니다.
주택 임대차 계약, 경미한 교통사고 합의, 소비자 분쟁조정 등 대다수의 서민들이 법치 사회에서 자주 마주하는 쟁점을 질의응답으로 세운 입문용 법률 챗봇 데이터셋입니다.
불 꺼 줘, 온도 올려 줘, 제습기 켜 줘 등 스마트 빌딩 및 홈네트워크 기기를 음성으로 원격 제어할 때 사용 빈도가 매우 높은 짧은 명령 오디오 코퍼스입니다.
한국 특유의 은유적 표현이나 사자성어, 전래 속담 등의 실제 어원을 설명하고, 상황별 올바른 적용 뉘앙스를 학습시키는 어휘 교정용 데이터셋입니다.
한국어 속담의 앞부분이나 상황적 맥락을 파악하고 비유 관계를 성립하기 위해 유기적인 빈칸 속담 채워 넣기용 언어적 유희 학습 데이터입니다.
영한 번역기 성능 고도화를 위해 '손발이 맞다', '눈을 붙이다' 등 개별 단어 직역으로는 파악이 불가능한 한국어 합성 숙어(Multi-word Expressions)를 자연스러운 영어 문맥으로 매칭한 코퍼스입니다.
주기적으로 업데이트되는 청소년 신조어, 온라인 커뮤니티 유행어, 신조 줄임말의 원형과 구체적인 사용 사례를 문맥화한 어휘 정렬용 데이터셋입니다.
온라인 채팅이나 모바일 텍스트에서 발생하는 수많은 맞춤법 오류, 신조어 파괴, 오탈자를 바른 문장으로 되돌리기 위한 기계 번역 포맷의 교정 코퍼스입니다.
배달의민족, 요기요 등 배달 요식 플랫폼의 짧은 리뷰와 매칭 평점을 정제하여 양질의 식단 피드백 챗봇과 리뷰 분석 대시보드를 생성하게 돕는 텍스트 데이터셋입니다.
방대한 위키 백과 및 오픈 지식 백과 문서의 상단 요약(Lead Section) 문장들을 추출하여, 검색 포털에 노출되는 한줄 요약을 자동 생성할 수 있게 학습하는 데이터셋입니다.
위키백과 사전에 등재된 공식 사실관계를 기초로, 한국어의 다채로운 질문 변형에 대해서도 일관된 단답 정답 혹은 근거 구절을 제공하는 기초 지식 추론 데이터셋입니다.
단순 직설 문장과 대비되는 은유적 비유 표현(예: '내 마음은 호수요')을 컴퓨터가 단순 명사 연합이 아닌 문학적 상징성으로 인지하여 다르게 번역하게 돕는 은유 분석 코퍼스입니다.
질문 텍스트의 어형과 조사를 인지하여, 사용자가 원하는 핵심 정보가 인물(Who), 시간(When), 장소(Where), 원인(Why), 방법(How), 사물(What) 중 무엇인지 분류하는 검색용 모델 데이터셋입니다.
사용자가 사용한 다른 어순, 다른 조사의 질문들이 결국 같은 시스템 호출 목적을 가지고 있는지 가려내기 위해 설계된 유사 의미 대조군 데이터셋입니다.
온라인 쇼핑 플랫폼에서 챗봇을 유기적으로 운영할 수 있도록 환불, 배송문의, 상품변경, 회원탈퇴 등 사용자 메시지에 담긴 주 의도(Intent)를 고정 맵으로 분류하는 데이터셋입니다.
과도하게 심각한 질병이 아닌 실생활 가벼운 증상(두통, 감기, 소화불량 등)에 대해 환자가 겪는 주호소와 기본적인 대처 상식을 정리한 의학 인스트럭션 코퍼스입니다.
한국 역사, 사회, 상식을 아우르는 5지선다형 LLM 훈련용 질문과 정답 셋입니다.
목적이 뚜렷한 질의응답이 아닌, 일상적인 가벼운 근황 공유 및 리액션을 수행하여 사용자와 AI 에이전트 간의 정서적 교감을 이끄는 스몰토크 대화쌍입니다.
음성 합성 및 받아쓰기 모델 개발 시 연음 법칙, 비음화, 자음동화 등 한글 표기와 실제 발음이 전치되는 현상(Grapheme-to-Phoneme)을 교정하는 정밀 사전 데이터셋입니다.
법률, 의학, 금융 등 난해한 한문 혼용 단어로 도배된 공문서 문장을 비전문가나 어린아이도 읽기 쉬운 현대식 순수 한글 용어로 가공하는 단순화(Text Simplification) 코퍼스입니다.
여러 신문사와 정부 보도자료의 장문 텍스트를 분석하여, 문맥의 어조를 훼손하지 않으면서 2~3문장의 명확한 초록(Abstract) 요약문을 도출하기 위한 학습 데이터입니다.
제공된 단락과 특정 키워드가 주어졌을 때, 해당 키워드를 정답으로 유도할 수 있는 자연스러운 형태의 역질문을 알아서 설계해 내는 학습용 데이터셋입니다.
사용자가 유해한 해킹, 개인정보 유출, 불법 약물 조제, 금융 사기 등에 대한 정보를 직/간접적으로 우회 질문(탈옥)할 때 정중하게 대답을 거절하도록 교육하는 안전성(Alignment) 데이터셋입니다.
영어 모국어가 아닌 한국인이 발화한 영어 단어와 회화 데이터를 담고 원어민 채점 기준을 부여한 리소스입니다.
어린이의 삐뚤삐뚤한 글씨부터 고령층의 고딕 붓글씨까지 수집한 손글씨 스타일 변환 및 해독 데이터셋입니다.
특정 핵심 개념어를 보았을 때 인간의 뇌 속에서 직관적으로 연상되는 연관 어휘(예: '여름' -> '바다', '수박')를 엮어 구축한 심리학 기반 어휘 연상 의미망 데이터셋입니다.
눈이 오면 길이 미끄러워진다거나, 차가운 물을 오래 마시면 배탈이 날 수 있다는 등 일반적이고 건전한 상식을 논리적으로 서술해 놓은 상식 사전 데이터셋입니다.
서로 다른 표정(분노, 기쁨, 중립)을 짓는 1만 명 안면 마이크로 픽셀 68개 랜드마크 데이터셋입니다.
외국 기술 용어 및 외래어를 한국인이 한글로 표기 및 정렬한 전용 자소 텍스트 데이터셋입니다.
고문헌 해독 및 한자 표기로 적힌 조선 시대 문헌 아카이브를 번역하기 위해 한문 구절과 현대어 해설을 대칭하여 통합한 정형 데이터셋입니다.
비빔밥, 김치찌개 등 400여 종 대표 음식 사진과 상세 칼로리 및 단백질 영양 성분 정보 매핑 리소스입니다.
바닷속 침몰 그물, 빈 병들을 잠수 스쿠버 및 무인 잠수정으로 정밀 촬영 확보한 수질 환경 보존 데이터입니다.
감기, 기관지염 환자의 기침 주파수 특성을 확보해 전염병 초기 탐지 모듈을 탑재하는 헬스케어 음성입니다.
안전 사각 구역의 안전 도모를 위해 폭력, 실신, 쓰레기 무단 투기 행동을 프레임 단위 라벨링한 데이터입니다.
현업 의류 디자이너가 주석한 상의, 하의, 아우터 아웃핏 스타일링 분류 이미지 데이터셋입니다.
한류 가요 가사를 의미 전달 및 영어 운율에 맞게 전문가가 초빙 번역한 특별한 리소스입니다.
방송 방송의 패널 구두 논쟁을 음성 인식 후, 쟁점 정리와 함께 논리적으로 서면 정리 요약한 데이터셋입니다.
문장 내에서 인명(PS), 기관(OG), 지명(LC), 날짜(DT) 등 특정 개체(Entity)를 인식하여 태깅하기 위한 한국어 대표 정보 추출용 데이터셋입니다.
공인된 의학 논문 및 학술서 속에서 질병(Disease), 약물(Chemical/Drug), 부작용(Side Effect), 인과성 간의 상관관계를 정확하게 분별하여 지식 그래프를 형성하도록 주석한 데이터셋입니다.
외산 파운데이션 모델에 한국어 지시 이행 및 창작, 편집, 분류 등의 능력을 골고루 분배하기 위해 제작된 범용 목적의 대규모 인스트럭션 데이터셋입니다.
주어진 뉴스, 백과사전 단락을 모델이 완벽하게 이해했는지 검증하기 위해 질문에 대해 예/아니오(Yes/No)로만 응답하도록 고안된 독해 평가 데이터셋입니다.
형태는 동일하나 문맥에 따라 다른 의미를 갖는 한국어의 동음이의어 및 다의어를 LLM이 명확히 분별하는지 정밀 스크리닝하는 데이터셋입니다.
글쓴이가 설명하는 앞선 상황 묘사를 읽고 뒤이어 나타날 가장 자연스러운 행동이나 사건 전개 시나리오를 선택하는 맥락 유추 추론 데이터셋입니다.
주어진 전제 상황에 부합하는 적절한 원인 혹은 인과적 결과(Alternative Settling of Cognitive Causality)를 객관식 보기 중에서 추론해내는 상식 역량 평가 데이터셋입니다.
구글 BIG-bench 중 한국어 문화 및 정서적 지식이 필요한 핵심 태스크만 정합한 평가 데이터셋입니다.
한국어 도메인 특화 상식과 일상적인 물리적 작용(부력, 중력, 가열 등)에 의한 현상을 논리정연하게 답변하도록 정제한 SFT용 인스트럭션 데이터셋입니다.
SKT KoGPT2 모델 사전 훈련용으로 설계된 공공 위키, 뉴스, 도서 통합 정제 말뭉치셋입니다.
한글 조사 하나나 미세한 접두사에 의해 완전히 종속되거나 포함 관계가 결정되는 단어적 지각과 문맥의 엄밀한 함의 및 포함 관계를 판별하는 정교한 어휘론 벤치마크입니다.
온라인 뉴스나 커뮤니티 댓글에 내포된 인간의 미묘한 감정을 기쁨, 분노, 슬픔, 당황, 영광 등 44가지 미세 감정 레이블로 정교하게 매핑한 정서 분류 데이터셋입니다.
한국의 유명 근현대 시 문학 구절을 분석하여, 각 연과 행에 담긴 화자의 주된 감정 상태(체념, 한, 기쁨, 그리움 등)를 정교하게 맵핑해 놓은 정서 레이블링 코퍼스입니다.
블로그, 커뮤니티, 메신저 등에서 비식별 정제 작업을 완료한 대규모 멀티턴 일상 대화 코퍼스입니다.
타인의 가상 일기나 스토리를 분석하여 등장인물의 신념, 의도, 거짓 신념(False Belief) 등 마음이해 지수(Theory of Mind)를 LLM이 심리학적으로 정확히 추론해 내는지 검증하는 정밀 데이터셋입니다.
External Data Resources
Beyond the GearDel catalog, these public lists on GitHub and blogs are useful references.
Source, license, and size — confirming these early reduces failed training runs.
Start with text, image, or speech. Narrow by tags on GearDel, then confirm format on the original page.
Commercial use depends on the original terms. Catalog license status is a hint — always re-check the provider docs.
Check provider, source URL, and size, then download from the original. GearDel does not host files.