GGearDel← 데이터셋 목록

데이터셋 / 이미지

🧮
멀티모달비전정밀묘사캡셔닝

한국어 이미지 정밀 묘사 데이터셋

멀티모달 Vision-Language 모델(VLM) 학습을 위해 사물, 인물, 배경이 혼재된 복잡한 이미지의 시각 정보를 한국어로 정밀 묘사해 놓은 데이터셋입니다.

상업적 이용 가능 (Apache 2.0)

출처

Hugging Face (Nagase-Kotono)

등록 연도

2024

데이터 크기

대용량 (7.85 GB)

구성

120K 이미지-텍스트 페어

원본 데이터셋에서 보기

DATA PREVIEW

이런 형태의 데이터예요

아래는 데이터 구조를 이해하기 위한 예시입니다. 실제 내려받기 전에는 원본 제공처의 최신 안내를 확인하세요.

텍스트 캡션

노을이 지는 한강 공원에서 한 남성이 자전거를 타고 아스팔트 길을 달리고 있으며, 배경에는 남산타워와 붉게 물든 하늘이 펼쳐져 있습니다.