데이터셋 / 이미지
🧮
멀티모달비전정밀묘사캡셔닝
한국어 이미지 정밀 묘사 데이터셋
멀티모달 Vision-Language 모델(VLM) 학습을 위해 사물, 인물, 배경이 혼재된 복잡한 이미지의 시각 정보를 한국어로 정밀 묘사해 놓은 데이터셋입니다.
출처
Hugging Face (Nagase-Kotono)
등록 연도
2024
데이터 크기
대용량 (7.85 GB)
구성
120K 이미지-텍스트 페어
DATA PREVIEW
이런 형태의 데이터예요
아래는 데이터 구조를 이해하기 위한 예시입니다. 실제 내려받기 전에는 원본 제공처의 최신 안내를 확인하세요.
텍스트 캡션
노을이 지는 한강 공원에서 한 남성이 자전거를 타고 아스팔트 길을 달리고 있으며, 배경에는 남산타워와 붉게 물든 하늘이 펼쳐져 있습니다.