AI Dataset Discovery라이선스 · 출처 · 한국어 데이터셋
한국어 AI 데이터셋 · 라이선스·출처 확인

한국어 AI 데이터셋,
라이선스와 출처까지 한눈에

KoBEST, 영수증 OCR, TTS, 지시문 학습까지 — 언어·라이선스·형식으로 찾고 원본 제공처로 이동합니다.GearDel은 한국어 NLP·음성·비전 탐색 카탈로그입니다. 파일은 호스팅하지 않습니다.

Try
Dataset Catalog

Browse AI datasets

Korean AI datasets from AI Hub, Hugging Face, GitHub, and NIKL—compare source, license, and size. GearDel does not host files.

Showing 243 of 243

Verification badges show catalog status per field — not every dataset is fully verified.

💡
텍스트한국어Text교과내용초중고

교과서 기반 에듀케이션 한국어 말뭉치

초중고 주요 교과과정 서적과 학습 보조 교재의 핵심 내용을 LLM 학습에 용이하도록 질의응답 및 설명글 형태로 재구성하여 분류한 데이터셋입니다.


SourceHugging Face (devngho)
Size대용량
FormatText
LicenseMIT
Source verifiedLicense needs review
텍스트Text쇼핑리뷰평점분석

네이버 쇼핑 상품 리뷰 감성 분석 데이터셋

인공지능 모델이 고객 리뷰의 어조를 정밀 분석할 수 있도록, 다양한 카테고리의 실제 네이버 쇼핑 평점(1~5점) 기반 긍·부정 텍스트 데이터셋입니다.


SourceGitHub (bab2min)
Size소용량
FormatText
LicenseCC BY-SA 4.0
Source verifiedLicense needs review
🔍
텍스트한국어Text문체변환다양성

다양한 문체 변환 한국어 인스트럭션

동일한 정보나 내용을 고전 시가풍, 비즈니스 이메일 톤, 일상 대화체, 문학 소설 등 여러 가지 문체(Writing Style)로 다채롭게 변환할 수 있도록 구축된 합성 데이터셋입니다.


SourceHugging Face (coastral)
Size중용량
FormatText
LicenseApache 2.0
Source verifiedLicense needs review
📰
텍스트한국어Text대명사추론상식평가

서울대 Ko-WinoGrande 한국어 대명사 지시 추론 데이터셋

한국어 텍스트 문맥 속에 모호하게 삽입된 대명사(그것, 그, 그녀 등)가 앞서 언급된 명사 중 물리적/사회적 상식 법칙에 의거하여 어떤 대상을 가리키는지 논리 판단을 검증하는 벤치마크입니다.


SourceHugging Face (thunder-research-group)
Size4.2MB
FormatText
LicenseMIT
Source verifiedLicense needs review
🦙
텍스트한국어Text부정문서울대

서울대 Thunder-KoNUBench 한국어 부정문 이해 데이터셋

한국어의 특유 부정 표지('안', '못', '-지 않-', '-지 못하-', '말다')가 포함된 문장에서 대형 언어 모델이 부정의 맥락을 얼마나 올바르게 인지하는지 문장 수준으로 평가하는 벤치마크입니다.


SourceHugging Face (thunder-research-group)
Size5.4MB
FormatText
LicenseMIT
Source verifiedLicense needs review
텍스트한국어Text챗봇감성대화

송영숙 한국어 챗봇 문답 데이터셋

한국어 챗봇 개발의 고전적이고 대표적인 오픈소스 자원으로, 일상다반사와 사랑, 이별 등 섬세한 감정 상태에 맞는 카운셀링 및 대화 데이터로 이뤄져 있습니다.


SourceGitHub
Size소용량
FormatText
LicenseCC BY 4.0 / MIT
Source verifiedLicense needs review
🦙
텍스트한국어Text수능영어정밀번역

수능 영어 지문 한글 초고밀 번역 데이터셋

외국 수능 지문 분석 모델을 평가하기 위해, 영어 수능 모의고사 및 본수능 문항들의 난해한 영어 구조를 지극히 한국어 맥락에 맞도록 정밀 정합하고 직역 및 의역 해설을 수록한 고난도 번역 코퍼스입니다.


SourceHugging Face (cfpark00)
Size5.5MB
FormatText
LicenseMIT
Source verifiedLicense needs review
🦙
텍스트Text윤리가이드악플방지

스마일게이트 Smilegate UnSmile 데이터셋

건전한 소셜 인공지능 윤리를 수립하기 위해 여성/가족, 성소수자, 인종/국적, 연령 등 총 10가지 차원의 악성 혐오 표현 여부를 레이블링한 데이터셋입니다.


SourceGitHub
Size소용량
FormatText
LicenseLicense unknown
Source verifiedLicense not verified
텍스트한국어Text게임리뷰스팀

스팀 한국어 게임 리뷰 감성 코퍼스

게임 플랫폼 스팀(Steam)의 한국어 유저 리뷰를 기반으로 유용함 및 추천 여부(긍정 1, 부정 0)를 가공하여 구성한 서브컬처/구어체 특화 분류 데이터셋입니다.


SourceGitHub (bab2min)
Size소용량
FormatText
LicenseCC BY-SA 4.0
Source verifiedLicense needs review
🦙
텍스트한국어Text엔비디아소버린AI

엔비디아 Nemotron 한국어 가상 페르소나 데이터셋

엔비디아(Nvidia)의 주도로 구축된 소버린 AI(Sovereign AI) 및 가상 데이터 증강용 데이터셋으로, 한국의 실제 다양한 연령, 성별, 직업별 사회문화적 성향을 다각도로 모사하는 가상 페르소나 인스트럭션 데이터셋입니다.


SourceHugging Face (nvidia)
Size120MB
FormatText
LicenseLicense unknown
Source verifiedLicense not verified
🔍
텍스트한국어TextFineWeb웹코퍼스

엘리스 한국어 FineWeb-Edu 데모 데이터셋

HuggingFace의 대표 교육용 데이터셋인 FineWeb-Edu의 정제 규칙을 벤치마킹하여 고품질 한국어 웹 자료만을 엄선해 구성한 고정제 사전학습 데이터셋입니다.


SourceHugging Face (eliceai)
Size중용량
FormatText
LicenseMIT
Source verifiedLicense needs review
텍스트한국어Text인스트럭션SFT

오픈 한국어 인스트럭션 데이터셋

인터넷에 공개된 양질의 한국어 SFT(Supervised Fine-Tuning)용 질문-대답 데이터들을 표준 포맷으로 통합 수집한 데이터셋입니다.


SourceHugging Face
Size대용량
FormatText
LicenseMIT
Source verifiedLicense needs review
📝
텍스트Text공공데이터정치

청와대 국민청원 데이터셋

국민청원 게시판에 게재되었던 청원 내용을 정제하여 자연어 처리 모델의 요약, 분류, 감성 분석 학습을 돕는 데이터셋입니다.


SourceHugging Face
Size대용량
FormatText
LicenseMIT
Source verifiedLicense needs review
텍스트한국어Text카카오NLI

카카오브레인 KorNLI 자연어 추론 데이터셋

미국 스탠포드대학의 SNLI 및 MultiNLI 데이터를 한국어 정서에 부합하도록 전문 번역 및 검수를 진행한 한국어 대표 자연어 추론(NLI) 데이터셋입니다.


SourceGitHub (kakaobrain)
Size대용량
FormatText
LicenseCC BY-SA 4.0
Source verifiedLicense needs review
📰
텍스트Text카카오STS

카카오브레인 KorSTS 문장 유사도 데이터셋

다양한 분야의 문장 쌍에 대해 미세한 의미 차이(Similarity)를 0점에서 5점까지 점수화하여 다면적인 문장 표상 임베딩 성능을 평가하는 데이터셋입니다.


SourceGitHub (kakaobrain)
Size소용량
FormatText
LicenseCC BY-SA 4.0
Source verifiedLicense needs review
🔍
텍스트한국어Text캐럿AI일상비서

캐럿AI 한국어 지시어 데이터셋

일반 상식과 일상적인 대화, 간단한 코딩 및 문서 수정 등 일상 비서 에이전트 성능을 보정하기 위한 고품질 데이터셋입니다.


SourceHugging Face
Size소용량
FormatText
LicenseApache 2.0
Source verifiedLicense needs review
📖
텍스트Text한국문화벤치마크

한국 문화 맥락 이해 벤치마크 데이터셋

한국의 독특한 사회적 분위기, 관습, 예절 등 문화적 맥락을 LLM이 제대로 인지하고 있는지 현실적인 시나리오로 평가하는 벤치마크 데이터셋입니다.


SourceHugging Face (SOGANG-ISDS)
Size소용량
FormatText
LicenseApache 2.0
Source verifiedLicense needs review
💡
텍스트Text여론분석정치텍스트

한국 선거 여론 및 미디어 오피니언 분석 데이터셋

2025년 한국 정계 개편 및 지지율 추이에 관한 국내 주요 언론 사설, 온라인 포럼 의견, 대중 여론조사 예측 결과의 미묘한 시각 차이와 극성을 수집 분석한 선거 오피니언 아카이브입니다.


SourceHugging Face (AFOS-Analytics1)
Size45MB
FormatText
LicenseMIT
Source verifiedLicense needs review
텍스트한국어Text웹텍스트사전학습

한국어 교육용 필터링 웹텍스트 데이터셋

웹의 방대한 데이터 중 교육적 가치(Educational Score)가 높은 고품질 텍스트만 머신러닝 분류기로 판별하여 선별한 사전학습용 말뭉치입니다.


SourceHugging Face (devngho)
Size대용량
FormatText
LicenseMIT
Source verifiedLicense needs review
📖
텍스트한국어Text금융재테크

한국어 금융 특화 지시어 데이터셋

부동산, 주식 시장, 기초 거시 경제 용어 등 금융 비즈니스 전문 도메인 질문과 답변을 정밀 학습하기 위한 Alpaca 스타일의 데이터셋입니다.


SourceHugging Face
Size중용량
FormatText
LicenseMIT
Source verifiedLicense needs review
🦙
텍스트한국어Text다단계추론전략QA

한국어 다단계 논리 추론 데이터셋

간단한 사실 매칭을 넘어, 참/거짓 판단을 유도하기 위해 다단계의 배경 지식 추론(Multi-hop Reasoning) 과정을 거치는 추론 검증 데이터셋입니다.


SourceHugging Face
Size소용량
FormatText
LicenseApache 2.0
Source verifiedLicense needs review
💬
텍스트한국어Text사전학습위키피디아

한국어 사전학습 위키 코퍼스

한국어 Foundation Model 학습을 위해 한국어 위키피디아 덤프 및 공개 데이터를 결합하여 정제 및 토큰화한 필수 코퍼스 데이터입니다.


SourceHugging Face
Size중용량
FormatText
LicenseMIT
Source verifiedLicense needs review
텍스트한국어Text상업용지시어

한국어 상업용 지시어 데이터셋

기업 및 스타트업이 라이선스 제약 없이 완전한 상업용 제품 개발에 투입할 수 있도록 MIT 라이선스로 선배포된 전천후 지시어 데이터셋입니다.


SourceHugging Face
Size대용량
FormatText
LicenseMIT
Source verifiedLicense needs review
🔍
텍스트한국어Text수학수식유도

한국어 수학 문장형 문제 풀이 데이터셋

수학적 지능(Mathematical Reasoning)을 기르기 위해, 복잡한 실생활 서사형 질문에서 추론하여 직접 논리적 수식을 세우고 풀이하는 코퍼스입니다.


SourceGitHub
Size소용량
FormatText
LicenseMIT
Source verifiedLicense needs review
💡
텍스트한국어Text가드레일윤리

한국어 온라인 댓글 욕설 탐지 데이터셋

인터넷 주요 커뮤니티의 다양한 댓글을 전처리하여 욕설, 공격성, 인신공격 여부를 이진 분류용으로 수동 라벨링한 인공지능 윤리 가드레일 데이터셋입니다.


SourceGitHub
Size소용량
FormatText
LicenseMIT
Source verifiedLicense needs review
🦙
텍스트한국어Text위키데이터정제텍스트

한국어 위키백과 정제 말뭉치

한국어 위키백과 정기 덤프 파일에서 마크다운 및 불필요한 문장 부호들을 완전 제거하고, 어휘 구조가 바른 순수 자연어 문장으로 필터링한 학습용 기본 코퍼스입니다.


SourceGitHub
Size중용량
FormatText
LicenseCC BY-SA 4.0
Source verifiedLicense needs review
🧮
이미지한국어Image멀티모달비전

한국어 이미지 정밀 묘사 데이터셋

멀티모달 Vision-Language 모델(VLM) 학습을 위해 사물, 인물, 배경이 혼재된 복잡한 이미지의 시각 정보를 한국어로 정밀 묘사해 놓은 데이터셋입니다.


SourceHugging Face (Nagase-Kotono)
Size대용량 (7.85 GB)
FormatImage
LicenseApache 2.0
Source verifiedLicense needs review
🔍
텍스트한국어Text교과서교육

한국어 인공 교과서 코퍼스 데이터셋

기본적인 교양 과학, 역사, 문학 등 지식 습득 능력을 극대화하기 위해 초·중·고교 교육과정 수준의 지식 구조를 인공 합성하여 전처리한 텍스트 말뭉치입니다.


SourceHugging Face
Size대용량
FormatText
LicenseApache 2.0
Source verifiedLicense needs review
📰
텍스트한국어Text구어체대화

한국어 일상 구어체 대화 데이터셋

인공지능 대화형 에이전트가 지나치게 딱딱한 어조를 탈피하고, 일반 사용자처럼 친근한 구어체 및 대화의 맥락(Context)을 이해할 수 있도록 설계된 데이터셋입니다.


SourceHugging Face
Size대용량
FormatText
LicenseApache 2.0
Source verifiedLicense needs review
📰
텍스트한국어Text에이전트함수호출

한국어 Function Calling 도구 사용 데이터셋

인공지능 에이전트가 외부 API나 DB 함수를 호출하는 능력(Tool Use / Function Calling)을 기를 수 있도록 대화 흐름을 한국어화한 데이터셋입니다.


SourceHugging Face (gyung)
Size소용량
FormatText
LicenseApache 2.0
Source verifiedLicense needs review
📖
텍스트한국어Text혐오표현안전성

BEEP! Korean Hate Speech

국내 온라인 포털 뉴스의 댓글 자원을 고정밀 분석하여 혐오 및 성희롱 편향을 수작업 감수한 리소스입니다.


SourceGitHub
Size1.2MB
FormatText
LicenseLicense unknown
Source verifiedLicense not verified
🎵
음성Audio전화음성ASR

ClovaCall

전화 통화 환경에서 발생하는 하드웨어 통화 채널 노이즈와 목적 대화를 정밀하게 담아낸 데이터입니다.


SourceGitHub
Size11,000명 이상
FormatAudio
LicenseLicense unknown
Source verifiedLicense not verified
👁
이미지ImageCLIP이미지

COYO-700M (카카오브레인)

카카오브레인이 글로벌 학술용으로 공개한 7억 장 규모의 초대형 웹 alt-text 이미지-텍스트 얼라인먼트입니다.


SourceHugging Face
Size대용량 (7억 쌍)
FormatImage
LicenseLicense unknown
Source verifiedLicense not verified
🦙
텍스트한국어Text수능국어비문학

CSAT-KOREAN-2025 대학수학능력시험 국어 데이터셋

2025학년도 대학수학능력시험 국어 영역(비문학, 문학, 화법과 작문, 언어와 매체) 전체 지문과 객관식 문항을 LLM의 종합 독해 및 논리 도메인 지식 성능 평가용으로 수록한 고도화된 시험 벤치마크입니다.


SourceHugging Face (KKACHI-HUB)
Size3.2MB
FormatText
LicenseMIT
Source verifiedLicense needs review
📖
텍스트한국어Text보안협박탐지

DKTC (Dataset of Korean Threat Dialogue)

금전 갈취, 신체적 무력 협박, 심리적 가스라이팅 지배 대화를 차단하기 위한 분류 주석 데이터입니다.


SourceGitHub
Size1.8MB
FormatText
LicenseLicense unknown
Source verifiedLicense not verified
텍스트한국어Text전문 분야QA

GovOn Legal Response Dataset

법률 해석과 근거 인용을 위한 한국어 instruction-tuning 데이터셋입니다.


SourceHugging Face
Size267 MB
FormatText
LicenseLicense unknown
Source verifiedLicense not verified
🦙
텍스트한국어Text혐오탐지다중분류

HateScore 한국어 다중 차원 혐오 감지 데이터셋

단순한 욕설 차원을 넘어 성별, 종교, 연령, 지역 등 현대 사회의 미묘하고 비정형적인 혐오 카테고리를 세분화하여 탐지하는 가드레일 데이터셋입니다.


SourceGitHub
Size중용량
FormatText
LicenseApache 2.0
Source verifiedLicense needs review
텍스트한국어Text에이전트웹탐색

K-BrowseComp 한국어 웹 브라우징 에이전트 벤치마크

인공지능 웹 에이전트 모델이 한국의 사회 문화적 맥락(쇼핑, 행정, 뷰티 등)이 담긴 실제 한국어 웹사이트들을 복합적으로 탐색하고 정답을 정확하게 가져오는지 수동 검증하기 위해 구축된 에이전트 평가셋입니다.


SourceHugging Face (prometheus-eval)
Size3.5MB
FormatText
LicenseMIT
Source verifiedLicense needs review
텍스트한국어Text벤치마크NLU

KLUE Benchmark

한국어 언어 이해를 평가하는 8개 과제(분류·NER·관계 추출·QA 등) 벤치마크입니다.


SourceHugging Face
Size62.3 MB
FormatText
LicenseLicense unknown
Source verifiedLicense not verified
💬
텍스트한국어Text벤치마크LLM

KMMLU

인문·사회부터 STEM까지 45개 분야의 한국어 객관식 LLM 평가 데이터셋입니다.


SourceHugging Face
Size70.7 MB
FormatText
LicenseLicense unknown
Source verifiedLicense not verified
🔍
텍스트한국어Text벤치마크전문직시험

KMMLU-Pro 전문 지식 평가 데이터셋

공인노무사, 변리사, 회계사, 세무사, 한의사, 치과의사 등 한국의 전문직 자격시험 및 학술 문항들을 수집하여 LLM의 고도화된 한국어 논리 및 지식 추론 능력을 평가하는 최신 벤치마크 데이터셋입니다.


SourceHugging Face (LGAI-EXAONE)
Size12MB
FormatText
LicenseApache 2.0
Source verifiedLicense needs review
텍스트Text인기지시문

KoAlpaca-v1.1a

네이버 지식인 정제 데이터 기반의 실생활 맥락 및 가이드라인 학습용 지시어 데이터셋입니다.


SourceHugging Face
Size대용량
FormatText
LicenseLicense unknown
Source verifiedLicense not verified
💡
텍스트한국어Text보캡빌드일렉트라

KoELECTRA 보캡 최적화 원시 텍스트 말뭉치

한국어 ELECTRA 모델 학습 및 어휘 사전(Vocabulary) 구성을 위해 나무위키, 위키백과, 뉴스 기사 등을 골고루 배합하고 신뢰성 높은 토큰들만 정밀 샘플링한 데이터셋입니다.


SourceGitHub (monologg)
Size대용량 (34GB)
FormatText
LicenseApache 2.0
Source verifiedLicense needs review
📞
음성한국어Audio악센트다국어화자

KoelLabs 다국어 화자 한국어 악센트 음성 데이터셋

한국어가 모국어가 아닌 외국인 화자(미국, 중국, 베트남 등)가 발화한 한국어 녹음 자료를 바탕으로 악센트 및 잘못된 발음 형태를 ASR이 올바르게 보정 인식하게 돕는 ASR 벤치마크입니다.


SourceHugging Face (KoelLabs)
Size18 GB
FormatAudio
LicenseApache 2.0
Source verifiedLicense needs review
🎨
이미지Image인물인식K팝

KoIn 한국 인플루언서 인물 인식 이미지 데이터셋

한국의 유명 연예인, 셀러브리티, K-POP 아이돌, 인플루언서의 실제 무대 역광 조명, 복잡한 군중 전경, SNS 일상 전경 등 비정형적이고 역동적인 환경에서의 이미지와 인물 라벨 정보를 결합한 컴퓨터 비전 데이터셋입니다.


SourceGitHub (dukong1)
Size140 GB
FormatImage
LicenseMIT
Source verifiedLicense needs review
📰
텍스트한국어Text벤치마크평가

KoInFoBench 한국어 지시어 이행 평가 데이터셋

한국어 대형 언어 모델(LLM)이 사람이 내린 다양한 제약 조건과 복잡한 지시 사항을 얼마나 정확히 이행하는지 평가하기 위한 벤치마크 데이터셋입니다.


SourceHugging Face
Size소용량
FormatText
LicenseMIT
Source verifiedLicense needs review
💡
텍스트한국어Text코딩논리추론

KOpen 고품질 에르메스 한국어 데이터셋

고도화된 코딩, 복잡한 논리 추론, 시스템 프롬프트 이행 등을 완수할 수 있도록 해외 우수 자원인 OpenHermes를 한국어로 번역 및 조정한 고품질 데이터셋입니다.


SourceHugging Face
Size중용량
FormatText
LicenseMIT
Source verifiedLicense needs review
텍스트한국어Text수능수리추론

Korean SAT Math 수능 수학 논리 추론 데이터셋

한국의 대학수학능력시험(수능) 및 평가원 모의고사 수학 4점짜리 고난도 기하, 미적분, 확률과 통계 문항의 수식 및 정밀 풀이 단계를 정형 수록한 AI 수리 추론 벤치마크입니다.


SourceHugging Face (Quadyun)
Size8.5MB
FormatText
LicenseMIT
Source verifiedLicense needs review
🖼
이미지한국어Image야외글자간판인식

Korean-Light-OCR (야외 간판 및 표지판)

실제 한국 도시 한복판의 야외 교통 표지판, 광고물, 세로형 식당 간판 등의 자연 전경 글자 해독 데이터셋입니다.


SourceGitHub
Size4.2GB
FormatImage
LicenseLicense unknown
Source verifiedLicense not verified
📝
텍스트한국어Text편향완화네이버

KoSBi 한국어 편향성 완화 데이터셋

한국 사회 내에 존재하는 나이, 성별, 직업 등에 대한 고정관념이나 차별적인 왜곡 문장을 정중하고 건전한 문장으로 대체한 완화 데이터셋입니다.


SourceGitHub
Size대용량
FormatText
LicenseMIT
Source verifiedLicense needs review
🎵
음성한국어Audio하이라이트유튜브

KoSum 한국어 유튜브 멀티모달 요약 데이터셋

2024년에서 2026년 사이에 업로드된 인기 한국어 유튜브 비디오 700개를 활용하여, 영상 시각 정보, 오디오 파형, 자막 텍스트 특징을 모두 결합한 한국어 멀티모달 비디오 요약 및 하이라이트 감지용 데이터셋입니다.


SourceHugging Face (iontail)
Size45GB
FormatAudio
LicenseMIT
Source verifiedLicense needs review
🔍
텍스트한국어Text역할극페르소나

KREW 한국어 페르소나 역할극(Role-Playing) 데이터셋

가상의 성격, 연령, 구체적인 직업군 또는 역사적 인물 페르소나를 모델에 이식하고, 해당 캐릭터 설정과 고유한 어투를 끝까지 유지하며 자연스럽게 대화를 이어가도록 설계된 SFT 데이터셋입니다.


SourceHugging Face (huggingface-KREW)
Size28MB
FormatText
LicenseMIT
Source verifiedLicense needs review
📣
음성JSON대용량자유발화

KsponSpeech (대규모 자유발화)

대한민국 공식 표준 1,000시간 분량의 자유 발화 정합 및 자소 단위 표기 학습용 음성 표준 데이터셋입니다.


SourceGitHub
Size1000시간
FormatJSON
LicenseLicense unknown
Source verifiedLicense not verified
🔍
텍스트한국어Text인기LLM

KULLM-v2 (한국어 지시문)

GPT4ALL, Dolly, Vicuna 데이터를 한국어로 번역한 지시문 학습 데이터셋입니다.


SourceHugging Face
Size180MB
FormatText
LicenseLicense unknown
Source verifiedLicense not verified
📰
텍스트한국어TextLIMA고품질

LIMA 한국어 고품질 극소정예 데이터셋

적은 부피로도 뛰어난 성능 향상을 꾀할 수 있도록 고품질의 영어 LIMA 가이드라인을 완전 한국어 정서에 맞춰 재번역 및 수정한 데이터셋입니다.


SourceHugging Face
Size소용량
FormatText
LicenseMIT
Source verifiedLicense needs review
🎙
음성한국어Audio음성합성TTS

MeloTTS 한국어 실시간 음성합성 데이터셋

고성능 하드웨어뿐만 아니라 CPU급 로컬 기기에서도 빠르게 대화체를 음성 합성할 수 있도록 전처리된 고품질 TTS 매칭 데이터셋입니다.


SourceHugging Face
Size중용량
FormatAudio
LicenseMIT
Source verifiedLicense needs review
📖
텍스트한국어Text선호도DPO

Orca 한국어 DPO 선호도 데이터셋

인간 피드백 반영 모델 정렬(Alignment)을 위한 DPO(Direct Preference Optimization) 학습용 한국어 선호도(Preferred/Rejected) 데이터셋입니다.


SourceHugging Face
Size중용량
FormatText
LicenseApache 2.0
Source verifiedLicense needs review
💡
텍스트한국어Text의미대조유사도

PAWS-X (ko) (문장 유사성 분류)

적대적으로 교묘히 배치된 다국어 유사 뉘앙스 문장 속에서 미세 의미 일치 여부를 파악하는 한국어 파트셋입니다.


SourceGitHub
Size5.1MB
FormatText
LicenseLicense unknown
Source verifiedLicense not verified
📰
텍스트한국어Text해래상식

QARV 한국어 인스트럭션 데이터셋

해래(HAE-RAE) 허브에서 구축한 지시어 학습 데이터셋으로, 한국어 상식과 자연어 이해력을 강화하기 위한 고품질 SFT 데이터입니다.


SourceHugging Face
Size중용량
FormatText
LicenseApache 2.0
Source verifiedLicense needs review
📸
이미지한국어Image시각장애인VQA

skt/KVQA (시각장애 보조)

시각장애인이 모바일 카메라로 직접 실물 객체를 촬영한 사진과 이에 대해 물어본 실제 한국어 질문 및 검수 답변셋입니다.


SourceHugging Face
Size100,445개 페어
FormatImage
LicenseLicense unknown
Source verifiedLicense not verified
🔍
텍스트한국어Text문체변환스타일

SmileStyle 한국어 다채로운 문체 변환 코퍼스

스마일게이트 AI 팀이 한국어 문체 다양성 연구를 위해 공개한 데이터셋으로, 일상적인 베이스 대화를 정중체, 격식체, 아재체, 소설체 등 총 10가지 이상의 컨셉과 말투로 일치시킨 대규모 어미 변환 병렬 데이터셋입니다.


SourceGitHub (smilegate-ai)
Size35MB
FormatText
LicenseMIT
Source verifiedLicense needs review
🦙
텍스트한국어Text논리추론서울대

SNU Ko-MuSR 한국어 다단계 추론 데이터셋

서울대학교 연구팀에서 제작한 데이터셋으로, 살인 사건 수사, 물건 배치, 팀 배정 등 긴 문맥 속에서 여러 단계의 논리적 단서를 조합해야 풀 수 있는 고난도 추론 데이터셋입니다.


SourceHugging Face (thunder-research-group)
Size소용량
FormatText
LicenseMIT
Source verifiedLicense needs review
텍스트한국어Text안전성네이버

SQuARe 한국어 민감 주제 안전성 데이터셋

AI가 정치, 젠더, 종교 등 편파적이기 쉬운 민감 주제에 대해 중립적이고 안전하게 우회하여 대답할 수 있도록 훈련하는 가드레일 데이터셋입니다.


SourceGitHub
Size중용량
FormatText
LicenseMIT
Source verifiedLicense needs review
💬
텍스트한국어Text사전학습동화

TinyStories 한국어 번역 데이터셋

어린이용 짧은 영어 동화 모음인 TinyStories를 한국어로 정밀 번역하고 정제한 초경량 언어 모델 사전학습 및 지시어 학습용 데이터셋입니다.


SourceHugging Face
Size대용량
FormatText
LicenseMIT
Source verifiedLicense needs review
📖
텍스트한국어Text다국어QA구글

TyDi-QA (ko) (구글 다국어 질의응답)

구글이 설계한 11개 복합 문자 체계 중 한글 위키백과 기반의 정합 질의응답 지식 모델용 데이터셋입니다.


SourceGitHub
Size18.5MB
FormatText
LicenseLicense unknown
Source verifiedLicense not verified
텍스트한국어Text사전학습말뭉치

WanJuanSiLu 한국어 고품질 웹 텍스트 코퍼스

저자원 언어 및 한국어 Foundation Model의 사전학습 성능을 상향 평준화하기 위해 수집된 대규모 텍스트 데이터셋으로, 정밀 휴리스틱 및 인공지능 클린 필터링 공정을 통과한 고신뢰도 웹 말뭉치입니다.


SourceHugging Face (opendatalab)
Size124 GB
FormatText
LicenseApache 2.0
Source verifiedLicense needs review
📻
음성한국어Audio음성인식ASR

Zeroth 한국어 음성 인식 오픈소스 데이터셋

국내 대표 음성인식(ASR) 프레임워크인 Kaldi의 빌드를 지원하고, 자유로운 비즈니스 음성 합성을 촉진하기 위해 배포된 대규모 음성 전사 데이터셋입니다.


SourceGitHub
Size대용량
FormatAudio
LicenseApache 2.0
Source verifiedLicense needs review
텍스트한국어Text공공표준어

모두의 말뭉치: 뉴스

문체 및 공적 어법 준수, 시사 지식 확충을 위한 대한민국 최대의 정제 신문 말뭉치 자원입니다.


Source국립국어원
Size대용량
FormatText
License국립국어원 사용서약
Source needs reviewLicense needs review
텍스트한국어Text메신저공공

모두의 말뭉치: 메신저

현실 실생활 줄임말, 자음 위주의 구어 표현을 구조적으로 학습하기 위한 모바일 메신저 전사 말뭉치입니다.


Source국립국어원
Size3.5MB
FormatText
License국립국어원 사용서약
Source needs reviewLicense needs review
🔍
텍스트한국어Text추천대화

한국어 대화 요약 데이터셋

대화 원문과 한 문장 요약문으로 구성된 한국어 대화 요약 학습 데이터입니다.


SourceAI Hub
Size대용량
FormatText
LicenseAI Hub 이용안내
Source needs reviewLicense needs review
텍스트한국어Text기계독해질의응답

한국어 질의응답 데이터셋 1.0 (KorQuAD)

한국어 기계 독해(MRC) 연구를 위한 Wikipedia 기반의 대규모 질의응답 데이터셋으로, 문맥을 읽고 질문의 답을 본문에서 정확히 찾아내는 모델을 만듭니다.


SourceKorQuAD 공식
Size중용량
FormatText
LicenseCC BY-ND 4.0
Source needs reviewLicense needs review
🔍
텍스트Text벤치마크문화지식

CLIcK (Cultural & Legal Knowledge)

한국의 고유 풍습, 명절, 일상 행정 규율 등을 LLM이 얼마나 정확하게 아는지 검정하는 시험 데이터셋입니다.


SourceGitHub
Size5.5MB
FormatText
LicenseLicense unknown
Source needs reviewLicense not verified
🔍
텍스트Text뉴스분류헤드라인

KLUE 연합뉴스 기사 제목 분류 데이터셋

신문 헤드라인을 보고 정치, 경제, 사회, 생활문화, IT과학, 세계 등 어느 뉴스 주제에 해당하는지 정확히 분류해 내는 다중 클래스 분류 데이터셋입니다.


SourceHugging Face (KLUE)
Size소용량
FormatText
LicenseCC BY-SA 4.0
Source needs reviewLicense needs review
텍스트한국어Text관계추출RE

KLUE 한국어 관계 추출 데이터셋

문장 속에 등장하는 두 개체(주체와 대상) 간의 시맨틱적 관계(예: 부모 자식 관계, 소속 기관 관계 등)를 규명하는 자연어 정보 추출 데이터셋입니다.


SourceHugging Face (KLUE)
Size소용량
FormatText
LicenseCC BY-SA 4.0
Source needs reviewLicense needs review
📖
텍스트한국어Text기계독해MRC

KLUE 한국어 기계독해 벤치마크

질문의 유형을 단순 사실 확인형뿐만 아니라 추론형, 부정형(질문에 대한 답이 본문에 없는 경우)까지 확장하여 모델의 독해력을 정교하게 판단하는 MRC 데이터셋입니다.


SourceHugging Face (KLUE)
Size중용량
FormatText
LicenseCC BY-SA 4.0
Source needs reviewLicense needs review
📰
텍스트한국어Text유사도STS

KLUE 한국어 유사도 측정 데이터셋

서로 다른 문장 두 개가 의미상으로 얼마나 유사한지를 0점에서 5점 사이의 실수값으로 세밀하게 채점해 둔 시맨틱 문장 유사도(Semantic Textual Similarity) 데이터셋입니다.


SourceHugging Face (KLUE)
Size소용량
FormatText
LicenseCC BY-SA 4.0
Source needs reviewLicense needs review
텍스트한국어Text자연어추론NLI

KLUE 한국어 자연어 추론 데이터셋

두 문장(전제와 가설) 사이의 논리적 관계가 참(Entailment), 모순(Contradiction), 중립(Neutral) 중 어느 것에 부합하는지 가려내는 고급 한국어 추론용 벤치마크입니다.


SourceHugging Face (KLUE)
Size소용량
FormatText
LicenseCC BY-SA 4.0
Source needs reviewLicense needs review
🔍
텍스트한국어Text벤치마크상식추론

KoBEST 언어 추론 벤치마크

한국어 LLM의 상식 추론, 인과 관계 판단 등을 다차원 검정하기 위해 특별 제작된 데이터셋입니다.


SourceHugging Face
Size5.1MB
FormatText
LicenseCC BY-SA 4.0
Source needs reviewLicense needs review
🚏
이미지한국어Image영수증OCR

Korean Receipts (금융 영수증 OCR)

카드 영수증, 간이 영수증 내부의 매장명, 일시, 부가세액, 품목 리스트를 구조화하여 추출하는 정산용 데이터셋입니다.


SourceHugging Face
Size95MB
FormatImage
LicenseLicense unknown
Source needs reviewLicense not verified
🧾
이미지한국어ImageRichTextOCR-VQA

KRETA (Korean Rich Text Visual QA)

포스터, 표식, 복잡한 실외 간판 레이아웃 내부의 디자인 텍스트를 기민하게 해독하는 이미지 데이터입니다.


SourceHugging Face
Size125MB
FormatImage
LicenseLicense unknown
Source needs reviewLicense not verified
📻
음성Audio음성합성TTS

KSS Dataset (성우 음성 합성)

전문 여성 성우의 맑은 낭독음과 정확한 발음 정렬로 유명한 베스트셀러 음성 합성(TTS) 데이터셋입니다.


SourceHugging Face
Size12시간+
FormatAudio
LicenseLicense unknown
Source needs reviewLicense not verified
📝
텍스트한국어Text한영번역자막

Open Subtitles (ko-en) (자막 번역)

실제 영화, 해외 드라마 자막 대사 데이터로 이루어져 인물 간 핑퐁 대화 구어체 학습에 안성맞춤인 대형 한영 병렬셋입니다.


SourceGitHub
Size대용량
FormatText
LicenseLicense unknown
Source needs reviewLicense not verified
🎧
음성한국어Audio감정인식음성분류

Speech Emotion Dataset (ko)

표준 문장 뒤에 숨겨진 인간의 분노, 짜증, 설렘 등 미묘한 감정 극성을 탐색하여 레이블링한 음성 분류셋입니다.


SourceGitHub
Size3.2GB
FormatAudio
LicenseLicense unknown
Source needs reviewLicense not verified
📸
이미지한국어Image표판독VQA

Table-VQA-ko (스캔문서 표 판독)

스캔 문서 내부의 복잡한 그리드 격자 수치와 정산 수치를 정확하게 산출하는 표 판독 전용 시각 QA 데이터입니다.


SourceHugging Face
Size185MB
FormatImage
LicenseLicense unknown
Source needs reviewLicense not verified
텍스트한국어Text한영번역집단지성

Tatoeba (ko-en)

전 세계 다국어 사용 자발적 참여 집단지성 번역 프로젝트 기반의 일상 표현 위주 정합 한영 병렬 자원입니다.


SourceGitHub
Size3.4MB
FormatText
LicenseLicense unknown
Source needs reviewLicense not verified
🎨
이미지한국어Image소방안전드론카메라

강원 영동 건조기 산림 화재 및 연기

초기 진압 드론의 산불 오탐 방지를 위해 구름과 연기, 안개를 예리하게 구분 정합한 훈련 이미지입니다.


SourceAI Hub
Size150GB
FormatImage
LicenseAI Hub 이용안내
Source not verifiedLicense needs review
🎧
음성한국어Audio콜센터고객상담

고객 콜센터 대화 녹취 및 음성

현업 통화 녹음 자료에서 유해한 신상을 완전히 제거하고, 상담 대화를 텍스트와 정합한 ASR 리소스입니다.


SourceAI Hub
Size800시간
FormatAudio
LicenseAI Hub 이용안내
Source not verifiedLicense needs review
텍스트한국어Text기계독해행정문서

공공 행정문서 대상 기계독해

국정 자료, 보도자료 등 행정 문서 속에서 정확한 지식 정답 위치를 검출하는 MRC 데이터셋입니다.


SourceAI Hub
Size180MB
FormatText
LicenseAI Hub 이용안내
Source not verifiedLicense needs review
📰
텍스트한국어Text행정문서요약

공공기관 배포 행정문서 요약본

각 부처에서 정기 발행하는 주요 정책 보고서와 실증 자료를 일목요연하게 텍스트 요약한 리소스입니다.


SourceAI Hub
Size410MB
FormatText
LicenseAI Hub 이용안내
Source not verifiedLicense needs review
🎵
음성한국어Audio기계고장음향검사

공장 모터 고장 진단 진동 및 음향

산업 기계 노후화에 따라 변형되는 비정상 미세 마찰음을 소리로 자동 검사하는 AI 솔루션 훈련셋입니다.


SourceAI Hub
Size120GB
FormatAudio
LicenseAI Hub 이용안내
Source not verifiedLicense needs review
텍스트한국어Text금융기계독해

금융 금융보고서 기계독해 데이터

기업 공시, 증권사 리포트 등 까다로운 도표 지표 정보를 포함한 전문 기계독해 학습 데이터셋입니다.


SourceAI Hub
Size140MB
FormatText
LicenseAI Hub 이용안내
Source not verifiedLicense needs review
🔍
텍스트한국어Text영화리뷰감성분석

네이버 영화 리뷰 감성 코퍼스 (NSMC)

한국어 자연어 처리 연구에서 가장 널리 쓰이는 기본 데이터셋으로, 영화 포털 사이트의 140자 평점을 긍정(1)과 부정(0)으로 분류해 둔 감성 텍스트 데이터셋입니다.


SourceGitHub (e9t)
Size소용량
FormatText
LicenseCC0
Source not verifiedLicense needs review
🔍
텍스트한국어Text네이버챌린지NER

네이버 NLP 챌린지 한국어 개체명 인식 데이터

2018년에 개최된 챌린지에서 공개된 데이터로, 텍스트 안에 내포된 각종 특수 태그(기관, 고유명사, 지명 등)들을 정밀 식별해 둔 대표 개체명 인식 데이터셋입니다.


SourceGitHub (Naver-NLP)
Size중용량
FormatText
LicenseCC0
Source not verifiedLicense needs review
🎙
음성한국어Audio음성합성다중화자

다중 화자 고품질 TTS 빌더 코퍼스

서로 다른 성별, 연령대의 일반인 화자 200명이 일정한 스크립트를 깔끔히 낭독한 합성 훈련용 리소스입니다.


SourceAI Hub
Size300시간
FormatAudio
LicenseAI Hub 이용안내
Source not verifiedLicense needs review
📰
텍스트한국어Text공공구어체

모두의 말뭉치: 구어

방송 프로그램, 일상 토론 등 실제 발화된 구어 텍스트를 고화질 전사 처리한 데이터셋입니다.


Source국립국어원
Size520MB
FormatText
License국립국어원 사용서약
Source not verifiedLicense needs review
🔍
텍스트한국어Text공공문어체

모두의 말뭉치: 도서 문장

저작권 협의가 완료된 현대 도서 텍스트 본문 문장 데이터로, 문어체 표준 문맥 학습에 용이합니다.


Source국립국어원
Size850MB
FormatText
License국립국어원 사용서약
Source not verifiedLicense needs review
💬
텍스트한국어Text공공SNS

모두의 말뭉치: 소셜 미디어

X(트위터), 인스타그램 등 공공 소셜 미디어 피드를 기반으로 구축된 최신 유행어 및 구어체 데이터셋입니다.


Source국립국어원
Size120MB
FormatText
License국립국어원 사용서약
Source not verifiedLicense needs review
텍스트한국어Text공공웹데이터

모두의 말뭉치: 웹 문서

블로그, 커뮤니티 등 인터넷 상의 다양한 웹 텍스트 자료를 정제하여 수집한 말뭉치입니다.


Source국립국어원
Size1.2GB
FormatText
License국립국어원 사용서약
Source not verifiedLicense needs review
📰
텍스트한국어Text공공일상대화

모두의 말뭉치: 일상 대화

다양한 주제에 대한 일반 대중의 일상 대화를 정제한 말뭉치 데이터셋입니다.


Source국립국어원
Size24.5MB
FormatText
License국립국어원 사용서약
Source not verifiedLicense needs review
텍스트한국어Text전문분야사전학습

산업별 전문 도메인 텍스트 말뭉치

자동차, 조선, 의료, 항공 등 10대 전략 산업 전문 논문 및 기술 가이드 문서 통합 사전학습 데이터셋입니다.


SourceAI Hub
Size3.5GB
FormatText
LicenseAI Hub 이용안내
Source not verifiedLicense needs review
📰
텍스트한국어Text세무법률

생활 법률 및 세무 행정 Q&A 데이터

상속세, 연말정산, 생활 분쟁 조율 등 시민 밀착형 법적 질의사항에 대한 전문가의 모범 답변 텍스트입니다.


SourceAI Hub
Size180MB
FormatText
LicenseAI Hub 이용안내
Source not verifiedLicense needs review
🚏
이미지한국어Image해안정비환경보호

서해안/남해안 해안 폐스티로폼 드론

드론 상공 비행을 통해 해수욕장 모래사장에 파묻힌 폐어구, 쓰레기를 식별 진단하는 시각 데이터셋입니다.


SourceAI Hub
Size520GB
FormatImage
LicenseAI Hub 이용안내
Source not verifiedLicense needs review
텍스트한국어Text고객상담소상공인

소상공인 1:1 고객상담 데이터

요식업, 소매업 등 오프라인 소상공인들이 접수받은 현실적 Q&A를 카테고리별 정형화한 데이터셋입니다.


SourceAI Hub
Size450MB
FormatText
LicenseAI Hub 이용안내
Source not verifiedLicense needs review
텍스트한국어Text소셜미디어악성댓글

소셜 미디어 한국어 악성 텍스트 필터링 데이터

인스타그램, 엑스(X), 유튜브 등 글로벌 사회관계망서비스(SNS)에서 포착되는 신종 비하 단어, 문맥 왜곡형 인격 모독 문장들을 실시간성 높게 수집해 정제한 필터링용 데이터셋입니다.


SourceGitHub
Size중용량
FormatText
LicenseApache 2.0
Source not verifiedLicense needs review
🗣
음성한국어Audio어린이음성인식

소아 및 어린이 구어 음성 인식

발음이 불완전한 5~13세 아동의 목소리를 정교하게 인식하기 위해 특별 학습된 ASR용 데이터입니다.


SourceAI Hub
Size120시간
FormatAudio
LicenseAI Hub 이용안내
Source not verifiedLicense needs review
텍스트Text속성분석리뷰마이닝

쇼핑 리뷰 어스펙트 기반 감정 분석 데이터

단순히 물건이 좋다 나쁘다가 아니라 '배송', '성능', '디자인', '가격' 등 소비자가 후기에서 거론하는 여러 특성(Aspect)별 속성 평점을 세분화한 데이터셋입니다.


SourceHugging Face
Size소용량
FormatText
LicenseMIT
Source not verifiedLicense needs review
🎵
음성한국어Audio노년층ASR

실버 세대 장노년층 구어 음성

목소리가 다소 잠기거나 발화 속도가 느린 65세 이상 노년층의 음성 인식을 지원하는 오디오 데이터셋입니다.


SourceAI Hub
Size150시간
FormatAudio
LicenseAI Hub 이용안내
Source not verifiedLicense needs review
💬
텍스트한국어Text비유어외국어학습

실생활 한국어 비유 표현 수집 코퍼스

외국인 학습자나 번역 AI가 오역하기 쉬운 실생활 비유어(예: '발이 넓다', '바가지를 씌우다')를 문맥 내에서 올바르게 이해하고 번역하도록 정립한 코퍼스입니다.


SourceHugging Face
Size소용량
FormatText
LicenseMIT
Source not verifiedLicense needs review
🎙
음성한국어Audio보이스피싱보안

실제 보이스피싱 가해자 범죄 음성

금융 사기 수사에서 추출한 사기범 통화 패턴을 모아, 금융사기 원스톱 사전 예방 봇을 훈련시키는 소중한 음성입니다.


SourceAI Hub
Size50시간
FormatAudio
LicenseAI Hub 이용안내
Source not verifiedLicense needs review
📣
음성한국어Audio드론소리탐지

야외 원격 조종 드론 프로펠러 소음

드론 침입을 소리로만 예리하게 탐지하도록 주변 드론 로터 소리와 생활 백색 소음을 융합한 오디오셋입니다.


SourceAI Hub
Size30GB
FormatAudio
LicenseAI Hub 이용안내
Source not verifiedLicense needs review
🗣
음성한국어Audio오디오북감정합성

오디오북 제작용 문학 성우 목소리

소설의 인물별 성격 묘사, 감정이 충만한 낭독 오디오와 오디오북 챕터별 대칭 텍스트 자원입니다.


SourceAI Hub
Size180시간
FormatAudio
LicenseAI Hub 이용안내
Source not verifiedLicense needs review
텍스트한국어Text뉴스사전학습

웹 기반 심층 뉴스 말뭉치

인터넷 신문 및 심층 기획 보도 기사를 고품질 맞춤법 필터링 후 가공한 대형 사전학습 텍스트입니다.


SourceAI Hub
Size2.4GB
FormatText
LicenseAI Hub 이용안내
Source not verifiedLicense needs review
📖
텍스트한국어Text요약도서

일반 도서 및 인프라 요약 데이터

일반 문학/학술 도서의 텍스트 주요 요점을 추출하여 추상 요약 모델 학습용으로 주석한 리소스입니다.


SourceAI Hub
Size620MB
FormatText
LicenseAI Hub 이용안내
Source not verifiedLicense needs review
텍스트한국어Text요약학술도서

전문 학술지 및 도서 요약 데이터

공학, 의학, 사회과학 등 전문 학술 도서의 고부하 단락을 전문 요약가가 직접 정제한 학습 데이터셋입니다.


SourceAI Hub
Size750MB
FormatText
LicenseAI Hub 이용안내
Source not verifiedLicense needs review
📞
음성한국어Audio국악악기연주

전통 악기 연주 및 음정 오디오셋

가야금, 거문고, 대금 등 전통 국악기 개별 음정 사운드를 고음질 채널로 추출하여 국악 AI 정합에 활용합니다.


SourceAI Hub
Size85GB
FormatAudio
LicenseAI Hub 이용안내
Source not verifiedLicense needs review
🎙
음성한국어Audio방언음성전사파일

지역별 방언 음성 코퍼스

전국 5개 도의 사투리를 생생하게 담은 녹음 음성 데이터와 자막 전사 파일 세트입니다.


SourceAI Hub
Size500시간
FormatAudio
LicenseAI Hub 이용안내
Source not verifiedLicense needs review
텍스트한국어Text방언표준어

지역별 한국어 방언 표준어 매치

경상, 전라, 충청, 강원, 제주 방언의 구어체를 정밀하게 표준어 본문과 병렬 구성한 데이터셋입니다.


SourceAI Hub
Size320MB
FormatText
LicenseAI Hub 이용안내
Source not verifiedLicense needs review
텍스트한국어Text특허전문분야

특허 명세서 분석 및 자동 Q&A

복잡한 특허 기술 설명서로부터 청구 범위 및 핵심 원리를 자동 질문 답변화한 리소스입니다.


SourceAI Hub
Size890MB
FormatText
LicenseAI Hub 이용안내
Source not verifiedLicense needs review
👁
이미지한국어Image피부진단헬스케어

피부과 탈모 및 여드름 아토피 접사

피부 임상 접사 사진을 수확하고 전문의가 염증 지수를 중증도 단계별로 세심 주석한 헬스케어 리소스입니다.


SourceAI Hub
Size320GB
FormatImage
LicenseAI Hub 이용안내
Source not verifiedLicense needs review
📦
이미지한국어ImageOCR도로간판

한국 거리 전경 고정밀 OCR 자료

실제 간판의 기괴하거나 필기체에 가까운 폰트 변주를 인식하기 위해 수집한 한국 지리학적 OCR 데이터입니다.


SourceAI Hub
Size1.5TB
FormatImage
LicenseAI Hub 이용안내
Source not verifiedLicense needs review
🦙
텍스트Text시인창작

한국 근현대 시 문학 말뭉치

한국의 대표 시인들의 퍼블릭 도메인 및 오픈소스 대상 시 작품을 정제하여, 인공지능이 문학적인 비유와 리듬감을 학습하고 창작할 수 있게 돕는 아카이브입니다.


SourceGitHub
Size소용량
FormatText
LicenseMIT
Source not verifiedLicense needs review
🎭
음성한국어Audio방언사투리

한국 방언 및 팔도 사투리 전사 메타데이터

제주도, 경상도, 전라도 등 고유한 억양과 고유 어휘를 사용하는 지방 방언 음성을 녹음하여 이에 대응하는 현대 표준 한글 자막과 대칭화한 전사 데이터셋입니다.


SourceAI Hub / GitHub
Size대용량
FormatAudio
LicenseApache 2.0
Source not verifiedLicense needs review
🔍
텍스트Text조리순서요리

한국 전통 요리법 및 조리 순서 데이터셋

다채로운 한식 요리들의 정량적인 식재료 구성과 1단계부터 마지막 조리까지의 흐름을 가독성 높게 규정화한 레시피 아카이브 데이터셋입니다.


SourceGitHub
Size소용량
FormatText
LicenseMIT
Source not verifiedLicense needs review
텍스트한국어Text특허번역한영병렬

한국 특허 정보 다국어 번역 병렬 데이터

기계 기계 번역 및 정밀 크로스보더 데이터 인덱싱을 지원하도록 설계된 과학, 물리, 화학 등 지식재산 특허청 명세서의 한-영 정렬 병렬 코퍼스입니다.


SourceGitHub / AI Hub
Size대용량
FormatText
LicenseApache 2.0
Source not verifiedLicense needs review
🎭
음성한국어Audio감정합성연기음성

한국어 7대 감정 음성 전사 데이터셋

슬픔, 기쁨, 분노, 당황, 상처, 불안, 중립의 7가지 감정을 인지하고 표현할 수 있도록, 연기 전문가들이 일상 대본을 기반으로 다른 톤으로 연기한 감정 가공 음향 아카이브입니다.


SourceAI Hub / GitHub
Size대용량
FormatAudio
LicenseApache 2.0
Source not verifiedLicense needs review
💬
텍스트한국어Text금융뉴스주가영향

한국어 금융 뉴스 감성 분석 데이터셋

경제 및 금융 기사 제목과 본문 요약을 바탕으로, 해당 이벤트가 특정 주가나 시장 경제에 긍정(Bullish), 부정(Bearish), 혹은 중립(Neutral) 영향을 미치는지 분별하기 위해 고안되었습니다.


SourceGitHub
Size소용량
FormatText
LicenseApache 2.0
Source not verifiedLicense needs review
텍스트한국어Text골드스탠다드정합평가

한국어 금표준(Gold Standard) 개체명 인식 데이터

수동 전처리 오차율을 극도로 줄여 AI 모델의 정밀 성능 검증용(Test Set)으로 사용할 수 있게 고안된 가장 공신력 높은 한국어 NER 골드 데이터셋입니다.


SourceGitHub
Size소용량
FormatText
LicenseMIT
Source not verifiedLicense needs review
텍스트한국어Text간호기록임상의학

한국어 기초 간호 기록지 익명 명세 코퍼스

개인 인적 사항과 민감 인공 정보를 완전 마스킹(De-identification) 처리한 뒤, 임상 및 간호 일지 속의 주요 전문 임상 어휘를 토큰화하고 계통별로 맵핑한 전문 의학 정보 데이터셋입니다.


SourceGitHub
Size중용량
FormatText
LicenseApache 2.0
Source not verifiedLicense needs review
🔍
텍스트한국어Text스팸필터보안

한국어 단문 및 장문 SMS 스팸 분류 데이터셋

불법 도박, 허위 광고, 금융 사기(피싱) 등 일상적으로 유포되는 불량 SMS/MMS 문자를 수집하여 정상(Ham)과 악성 스팸(Spam)으로 이진화한 데이터셋입니다.


SourceGitHub
Size소용량
FormatText
LicenseMIT
Source not verifiedLicense needs review
📖
텍스트한국어Text대규모독해표해석

한국어 대규모 기계독해 데이터셋 2.0 (KorQuAD)

위키피디아 전체 문서를 대상으로 HTML 표(Table)나 복잡한 서식을 해석하고 구조화된 장문 속에서 정보를 탐색해 내는 고차원 엔지니어링용 독해 데이터셋입니다.


SourceKorQuAD 공식
Size대용량 (표 포함)
FormatText
LicenseCC BY-ND 4.0
Source not verifiedLicense needs review
📝
텍스트한국어Text말투변환스타일트랜스퍼

한국어 말투 및 종결어미 스타일 변환 데이터셋

동일한 전달 문장을 평어(반말), 극존칭, 문어체, 해요체, 인터넷 유행어 등 수용하는 상황과 대화 상대에 어울리는 최적의 말투로 유기적 변환을 돕는 패러프레이즈 데이터셋입니다.


SourceGitHub
Size중용량
FormatText
LicenseMIT
Source not verifiedLicense needs review
텍스트한국어Text문법교정비문식별

한국어 문법성 판단 및 비문 교정 데이터셋

한국어 조사 사용 오류('은/는', '이/가'), 주어-서술어 호응 불일치, 불완전한 문장 구조 등의 비문(Grammar Error)을 판별하고 정합된 정문으로 도출하기 위한 문법 교육용 교퍼스입니다.


SourceGitHub
Size소용량
FormatText
LicenseMIT
Source not verifiedLicense needs review
텍스트한국어Text반어법비꼼

한국어 반어법 및 비꼼 감정 분류 데이터셋

텍스트 표면적으로는 긍정형 단어를 사용하나 실제로는 부정적인 비꼼이나 조롱을 조형하는 반어법(Sarcasm)을 모델이 가려낼 수 있도록 라벨링한 정교한 데이터셋입니다.


SourceGitHub
Size소용량
FormatText
LicenseMIT
Source not verifiedLicense needs review
텍스트한국어Text논증마이닝근거추출

한국어 사설 및 논설 아규먼트 마이닝 데이터셋

칼럼이나 설득문 논설 텍스트 속에서 필자가 내세우는 핵심 주장(Claim)과 이를 뒷받침하는 구체적인 객관적 근거(Premise)의 인과 관계 구조를 추적하는 마이닝 데이터셋입니다.


SourceGitHub
Size소용량
FormatText
LicenseMIT
Source not verifiedLicense needs review
텍스트한국어Text상식평가객관식

한국어 상식 추론 객관식 평가 벤치마크

학술 연구나 교과 지식 외에, 일반인이라면 인지해야 하는 직관적이고 사소한 기초 생활 상식을 바탕으로 다지선다 보기 중 합리적인 정답을 논리적으로 고르는 벤치마크입니다.


SourceHugging Face
Size소용량
FormatText
LicenseApache 2.0
Source not verifiedLicense needs review
💬
텍스트한국어Text생활법률민원상담

한국어 생활 법률 민원 지식 데이터셋

주택 임대차 계약, 경미한 교통사고 합의, 소비자 분쟁조정 등 대다수의 서민들이 법치 사회에서 자주 마주하는 쟁점을 질의응답으로 세운 입문용 법률 챗봇 데이터셋입니다.


SourceHugging Face
Size중용량
FormatText
LicenseApache 2.0
Source not verifiedLicense needs review
📞
음성한국어AudioIoT제어단답음성

한국어 소형 IoT 스마트홈 제어 음성 데이터

불 꺼 줘, 온도 올려 줘, 제습기 켜 줘 등 스마트 빌딩 및 홈네트워크 기기를 음성으로 원격 제어할 때 사용 빈도가 매우 높은 짧은 명령 오디오 코퍼스입니다.


SourceGitHub
Size중용량
FormatAudio
LicenseApache 2.0
Source not verifiedLicense needs review
💬
텍스트한국어Text속담사자성어

한국어 속담 및 관용구 해석 데이터셋

한국 특유의 은유적 표현이나 사자성어, 전래 속담 등의 실제 어원을 설명하고, 상황별 올바른 적용 뉘앙스를 학습시키는 어휘 교정용 데이터셋입니다.


SourceGitHub
Size소용량
FormatText
LicenseMIT
Source not verifiedLicense needs review
📖
텍스트한국어Text속담상식평가

한국어 속담 빈칸 완성 데이터셋

한국어 속담의 앞부분이나 상황적 맥락을 파악하고 비유 관계를 성립하기 위해 유기적인 빈칸 속담 채워 넣기용 언어적 유희 학습 데이터입니다.


SourceGitHub
Size소용량
FormatText
LicenseMIT
Source not verifiedLicense needs review
💡
텍스트한국어Text한영번역숙어오역

한국어 숙어 및 다어휘식 영어 번역 병렬 데이터셋

영한 번역기 성능 고도화를 위해 '손발이 맞다', '눈을 붙이다' 등 개별 단어 직역으로는 파악이 불가능한 한국어 합성 숙어(Multi-word Expressions)를 자연스러운 영어 문맥으로 매칭한 코퍼스입니다.


SourceGitHub
Size소용량
FormatText
LicenseMIT
Source not verifiedLicense needs review
🔍
텍스트한국어Text맞춤법오탈자

한국어 오탈자 및 띄어쓰기 문장 교정 코퍼스

온라인 채팅이나 모바일 텍스트에서 발생하는 수많은 맞춤법 오류, 신조어 파괴, 오탈자를 바른 문장으로 되돌리기 위한 기계 번역 포맷의 교정 코퍼스입니다.


SourceGitHub
Size중용량
FormatText
LicenseMIT
Source not verifiedLicense needs review
📖
텍스트한국어Text음식리뷰배달리뷰

한국어 요식업 배달 앱 리뷰 감성 분류 데이터셋

배달의민족, 요기요 등 배달 요식 플랫폼의 짧은 리뷰와 매칭 평점을 정제하여 양질의 식단 피드백 챗봇과 리뷰 분석 대시보드를 생성하게 돕는 텍스트 데이터셋입니다.


SourceGitHub
Size중용량
FormatText
LicenseMIT
Source not verifiedLicense needs review
📝
텍스트한국어Text위키백과초록생성

한국어 위키 개요 자동 요약 데이터셋

방대한 위키 백과 및 오픈 지식 백과 문서의 상단 요약(Lead Section) 문장들을 추출하여, 검색 포털에 노출되는 한줄 요약을 자동 생성할 수 있게 학습하는 데이터셋입니다.


SourceHugging Face
Size중용량
FormatText
LicenseCC BY-SA 4.0
Source not verifiedLicense needs review
📝
텍스트한국어Text위키상식단답QA

한국어 위키피디아 기반 상식 질의응답 데이터셋

위키백과 사전에 등재된 공식 사실관계를 기초로, 한국어의 다채로운 질문 변형에 대해서도 일관된 단답 정답 혹은 근거 구절을 제공하는 기초 지식 추론 데이터셋입니다.


SourceHugging Face
Size중용량
FormatText
LicenseMIT
Source not verifiedLicense needs review
텍스트한국어Text은유법상징분석

한국어 은유 및 시적 비유 감지 데이터셋

단순 직설 문장과 대비되는 은유적 비유 표현(예: '내 마음은 호수요')을 컴퓨터가 단순 명사 연합이 아닌 문학적 상징성으로 인지하여 다르게 번역하게 돕는 은유 분석 코퍼스입니다.


SourceGitHub
Size소용량
FormatText
LicenseMIT
Source not verifiedLicense needs review
📖
텍스트한국어Text의문사분류인텐트

한국어 의문사 기반 질문 분류 데이터셋

질문 텍스트의 어형과 조사를 인지하여, 사용자가 원하는 핵심 정보가 인물(Who), 시간(When), 장소(Where), 원인(Why), 방법(How), 사물(What) 중 무엇인지 분류하는 검색용 모델 데이터셋입니다.


SourceGitHub
Size소용량
FormatText
LicenseMIT
Source not verifiedLicense needs review
💡
텍스트한국어Text문장유사성동치판별

한국어 의미상 동치 문장 판별 데이터셋

사용자가 사용한 다른 어순, 다른 조사의 질문들이 결국 같은 시스템 호출 목적을 가지고 있는지 가려내기 위해 설계된 유사 의미 대조군 데이터셋입니다.


SourceHugging Face
Size중용량
FormatText
LicenseApache 2.0
Source not verifiedLicense needs review
📖
텍스트한국어Text고객상담챗봇인텐트

한국어 이커머스 쇼핑몰 고객 의도 분류 데이터

온라인 쇼핑 플랫폼에서 챗봇을 유기적으로 운영할 수 있도록 환불, 배송문의, 상품변경, 회원탈퇴 등 사용자 메시지에 담긴 주 의도(Intent)를 고정 맵으로 분류하는 데이터셋입니다.


SourceGitHub
Size소용량
FormatText
LicenseMIT
Source not verifiedLicense needs review
💬
텍스트한국어Text의학상담자가진단

한국어 일반 의학 및 자가 진단 상담 데이터셋

과도하게 심각한 질병이 아닌 실생활 가벼운 증상(두통, 감기, 소화불량 등)에 대해 환자가 겪는 주호소와 기본적인 대처 상식을 정리한 의학 인스트럭션 코퍼스입니다.


SourceHugging Face
Size중용량
FormatText
LicenseApache 2.0
Source not verifiedLicense needs review
📝
텍스트한국어Text스몰토크감성대화

한국어 일상 스몰토크 치챗 코퍼스

목적이 뚜렷한 질의응답이 아닌, 일상적인 가벼운 근황 공유 및 리액션을 수행하여 사용자와 AI 에이전트 간의 정서적 교감을 이끄는 스몰토크 대화쌍입니다.


SourceGitHub
Size중용량
FormatText
LicenseMIT
Source not verifiedLicense needs review
텍스트한국어Text연음법칙자소음소

한국어 자소-음소 변환 소리 정렬 데이터셋

음성 합성 및 받아쓰기 모델 개발 시 연음 법칙, 비음화, 자음동화 등 한글 표기와 실제 발음이 전치되는 현상(Grapheme-to-Phoneme)을 교정하는 정밀 사전 데이터셋입니다.


SourceGitHub
Size소용량
FormatText
LicenseMIT
Source not verifiedLicense needs review
📖
텍스트한국어Text단순화순화어

한국어 전문 한자 용어 쉬운 말 풀이 코퍼스

법률, 의학, 금융 등 난해한 한문 혼용 단어로 도배된 공문서 문장을 비전문가나 어린아이도 읽기 쉬운 현대식 순수 한글 용어로 가공하는 단순화(Text Simplification) 코퍼스입니다.


SourceHugging Face
Size소용량
FormatText
LicenseApache 2.0
Source not verifiedLicense needs review
💬
텍스트한국어Text보도자료생성요약

한국어 주요 일간지 뉴스 생성형 요약 코퍼스

여러 신문사와 정부 보도자료의 장문 텍스트를 분석하여, 문맥의 어조를 훼손하지 않으면서 2~3문장의 명확한 초록(Abstract) 요약문을 도출하기 위한 학습 데이터입니다.


SourceHugging Face / AI Hub
Size대용량
FormatText
LicenseApache 2.0
Source not verifiedLicense needs review
📰
텍스트한국어Text질문생성역질문

한국어 질문 자동 생성(QG) 데이터셋

제공된 단락과 특정 키워드가 주어졌을 때, 해당 키워드를 정답으로 유도할 수 있는 자연스러운 형태의 역질문을 알아서 설계해 내는 학습용 데이터셋입니다.


SourceHugging Face
Size소용량
FormatText
LicenseApache 2.0
Source not verifiedLicense needs review
📝
텍스트한국어Text탈옥방지가드레일

한국어 AI 모델 불법 및 탈옥 거부 응답 데이터셋

사용자가 유해한 해킹, 개인정보 유출, 불법 약물 조제, 금융 사기 등에 대한 정보를 직/간접적으로 우회 질문(탈옥)할 때 정중하게 대답을 거절하도록 교육하는 안전성(Alignment) 데이터셋입니다.


SourceHugging Face
Size소용량
FormatText
LicenseApache 2.0
Source not verifiedLicense needs review
🎭
음성한국어Audio발음평가한국인영어

한국인 고유 영어 발음 및 평가 음성

영어 모국어가 아닌 한국인이 발화한 영어 단어와 회화 데이터를 담고 원어민 채점 기준을 부여한 리소스입니다.


SourceAI Hub
Size140시간
FormatAudio
LicenseAI Hub 이용안내
Source not verifiedLicense needs review
텍스트Text단어연상의미망

한국인 단어 연상 의미망 코퍼스

특정 핵심 개념어를 보았을 때 인간의 뇌 속에서 직관적으로 연상되는 연관 어휘(예: '여름' -> '바다', '수박')를 엮어 구축한 심리학 기반 어휘 연상 의미망 데이터셋입니다.


SourceGitHub
Size소용량
FormatText
LicenseMIT
Source not verifiedLicense needs review
📝
텍스트Text상식추론연쇄논리

한국인 생활 상식 및 논리적 연쇄 추론 데이터

눈이 오면 길이 미끄러워진다거나, 차가운 물을 오래 마시면 배탈이 날 수 있다는 등 일반적이고 건전한 상식을 논리적으로 서술해 놓은 상식 사전 데이터셋입니다.


SourceHugging Face / GitHub
Size중용량
FormatText
LicenseApache 2.0
Source not verifiedLicense needs review
📝
텍스트한국어Text외래어발음

한국인 외래어 한영 발음 전사

외국 기술 용어 및 외래어를 한국인이 한글로 표기 및 정렬한 전용 자소 텍스트 데이터셋입니다.


SourceAI Hub
Size55MB
FormatText
LicenseAI Hub 이용안내
Source not verifiedLicense needs review
텍스트한국어Text한문한자

한문 한자-한글 대칭 수동 번역 데이터셋

고문헌 해독 및 한자 표기로 적힌 조선 시대 문헌 아카이브를 번역하기 위해 한문 구절과 현대어 해설을 대칭하여 통합한 정형 데이터셋입니다.


SourceGitHub
Size중용량
FormatText
LicenseCC0
Source not verifiedLicense needs review
🎙
음성한국어Audio기침헬스케어

호흡기 기침 및 비정상 호흡 사운드

감기, 기관지염 환자의 기침 주파수 특성을 확보해 전염병 초기 탐지 모듈을 탑재하는 헬스케어 음성입니다.


SourceAI Hub
Size15GB
FormatAudio
LicenseAI Hub 이용안내
Source not verifiedLicense needs review
🏥
이미지한국어Image이상행동CCTV안전

CCTV 지하철 통로 주취 폭행 및 배회

안전 사각 구역의 안전 도모를 위해 폭력, 실신, 쓰레기 무단 투기 행동을 프레임 단위 라벨링한 데이터입니다.


SourceAI Hub
Size5TB
FormatImage
LicenseAI Hub 이용안내
Source not verifiedLicense needs review
🎨
이미지한국어Image패션멀티레이블

K-패션 의류 및 코디 메타데이터

현업 의류 디자이너가 주석한 상의, 하의, 아우터 아웃핏 스타일링 분류 이미지 데이터셋입니다.


SourceAI Hub
Size850GB
FormatImage
LicenseAI Hub 이용안내
Source not verifiedLicense needs review
📝
텍스트한국어Text방송토론요약

KBS/MBC 시사 토론 및 교양 방송 요약

방송 방송의 패널 구두 논쟁을 음성 인식 후, 쟁점 정리와 함께 논리적으로 서면 정리 요약한 데이터셋입니다.


SourceAI Hub
Size440MB
FormatText
LicenseAI Hub 이용안내
Source not verifiedLicense needs review
텍스트한국어Text개체명인식NER

KLUE 한국어 개체명 인식 데이터셋

문장 내에서 인명(PS), 기관(OG), 지명(LC), 날짜(DT) 등 특정 개체(Entity)를 인식하여 태깅하기 위한 한국어 대표 정보 추출용 데이터셋입니다.


SourceHugging Face (KLUE)
Size중용량
FormatText
LicenseCC BY-SA 4.0
Source not verifiedLicense needs review
📝
텍스트한국어Text임상의학의학RE

KMRE 한국어 임상의학 논문 관계 추출 데이터셋

공인된 의학 논문 및 학술서 속에서 질병(Disease), 약물(Chemical/Drug), 부작용(Side Effect), 인과성 간의 상관관계를 정확하게 분별하여 지식 그래프를 형성하도록 주석한 데이터셋입니다.


SourceGitHub
Size15MB
FormatText
LicenseApache 2.0
Source not verifiedLicense needs review
🦙
텍스트한국어TextLlamaSFT

Ko-Llama 다각적 지시어 미세조정 데이터셋

외산 파운데이션 모델에 한국어 지시 이행 및 창작, 편집, 분류 등의 능력을 골고루 분배하기 위해 제작된 범용 목적의 대규모 인스트럭션 데이터셋입니다.


SourceHugging Face
Size대용량
FormatText
LicenseApache 2.0
Source not verifiedLicense needs review
🔍
텍스트TextBoolQ참거짓

KoBEST 단단문 참거짓 판정 (BoolQ)

주어진 뉴스, 백과사전 단락을 모델이 완벽하게 이해했는지 검증하기 위해 질문에 대해 예/아니오(Yes/No)로만 응답하도록 고안된 독해 평가 데이터셋입니다.


SourceHugging Face (SKT-brain)
Size소용량
FormatText
LicenseApache 2.0
Source not verifiedLicense needs review
🔍
텍스트한국어TextWiC다의어

KoBEST 문맥상 어휘 다의어 추론 (WiC)

형태는 동일하나 문맥에 따라 다른 의미를 갖는 한국어의 동음이의어 및 다의어를 LLM이 명확히 분별하는지 정밀 스크리닝하는 데이터셋입니다.


SourceHugging Face (SKT-brain)
Size소용량
FormatText
LicenseApache 2.0
Source not verifiedLicense needs review
💡
텍스트Text상황유추맥락이해

KoBEST 상황 지속성 추론 (HellaSwag)

글쓴이가 설명하는 앞선 상황 묘사를 읽고 뒤이어 나타날 가장 자연스러운 행동이나 사건 전개 시나리오를 선택하는 맥락 유추 추론 데이터셋입니다.


SourceHugging Face (SKT-brain)
Size소용량
FormatText
LicenseApache 2.0
Source not verifiedLicense needs review
📝
텍스트Text인과추론상식평가

KoBEST 언어추론 벤치마크 (COPA)

주어진 전제 상황에 부합하는 적절한 원인 혹은 인과적 결과(Alternative Settling of Cognitive Causality)를 객관식 보기 중에서 추론해내는 상식 역량 평가 데이터셋입니다.


SourceHugging Face (SKT-brain)
Size소용량
FormatText
LicenseApache 2.0
Source not verifiedLicense needs review
📝
텍스트한국어Text벤치마크LLM

KoBigBench Lite

구글 BIG-bench 중 한국어 문화 및 정서적 지식이 필요한 핵심 태스크만 정합한 평가 데이터셋입니다.


SourceHugging Face
Size12MB
FormatText
LicenseLicense unknown
Source not verifiedLicense not verified
📝
텍스트한국어Text상식SFT인스트럭션

KoCoSa 한국어 세부적 상식 추론 지시 데이터셋

한국어 도메인 특화 상식과 일상적인 물리적 작용(부력, 중력, 가열 등)에 의한 현상을 논리정연하게 답변하도록 정제한 SFT용 인스트럭션 데이터셋입니다.


SourceGitHub
Size18MB
FormatText
LicenseApache 2.0
Source not verifiedLicense needs review
📖
텍스트Text사전학습GPT2

KoGPT2 기본 사전학습 코퍼스

SKT KoGPT2 모델 사전 훈련용으로 설계된 공공 위키, 뉴스, 도서 통합 정제 말뭉치셋입니다.


SourceHugging Face
Size3.2GB
FormatText
LicenseLicense unknown
Source not verifiedLicense not verified
💡
텍스트한국어Text어휘론함의분석

KoSEnd 한국어 어휘론적 함의(Entailment) 데이터셋

한글 조사 하나나 미세한 접두사에 의해 완전히 종속되거나 포함 관계가 결정되는 단어적 지각과 문맥의 엄밀한 함의 및 포함 관계를 판별하는 정교한 어휘론 벤치마크입니다.


SourceGitHub
Size6.2MB
FormatText
LicenseApache 2.0
Source not verifiedLicense needs review
📰
텍스트한국어Text감정분류정서분석

KOTE 한국어 온라인 댓글 감정 데이터셋

온라인 뉴스나 커뮤니티 댓글에 내포된 인간의 미묘한 감정을 기쁨, 분노, 슬픔, 당황, 영광 등 44가지 미세 감정 레이블로 정교하게 매핑한 정서 분류 데이터셋입니다.


SourceHugging Face (searle-j)
Size중용량
FormatText
LicenseMIT
Source not verifiedLicense needs review
🔍
텍스트한국어Text시문학정서주석

KPoEM 한국어 고전 시 문학 정서 주석 데이터셋

한국의 유명 근현대 시 문학 구절을 분석하여, 각 연과 행에 담긴 화자의 주된 감정 상태(체념, 한, 기쁨, 그리움 등)를 정교하게 맵핑해 놓은 정서 레이블링 코퍼스입니다.


SourceGitHub
Size4.2MB
FormatText
LicenseMIT
Source not verifiedLicense needs review
텍스트한국어TextSNS비식별

SNS 소셜 대화 정제 데이터셋

블로그, 커뮤니티, 메신저 등에서 비식별 정제 작업을 완료한 대규모 멀티턴 일상 대화 코퍼스입니다.


SourceAI Hub
Size980MB
FormatText
LicenseAI Hub 이용안내
Source not verifiedLicense needs review
💡
텍스트한국어Text마음이해인지심리

ToM-Diary 한국어 마음이해(Theory of Mind) 데이터셋

타인의 가상 일기나 스토리를 분석하여 등장인물의 신념, 의도, 거짓 신념(False Belief) 등 마음이해 지수(Theory of Mind)를 LLM이 심리학적으로 정확히 추론해 내는지 검증하는 정밀 데이터셋입니다.


SourceGitHub
Size8.5MB
FormatText
LicenseApache 2.0
Source not verifiedLicense needs review

External Data Resources

External Korean NLP corpus lists

Beyond the GearDel catalog, these public lists on GitHub and blogs are useful references.

Suggested
Beginner Guide

New here?
Check these three first.

Source, license, and size — confirming these early reduces failed training runs.

01

Type / modality

Start with text, image, or speech. Narrow by tags on GearDel, then confirm format on the original page.

02

License

Commercial use depends on the original terms. Catalog license status is a hint — always re-check the provider docs.

03

Source & scale

Check provider, source URL, and size, then download from the original. GearDel does not host files.