👁️
Vision-Language Model
이미지와 텍스트를 함께 이해하는 AI
Vision-Language Model(VLM)은 시각 정보와 텍스트를 통합적으로 이해하는 AI입니다. 이미지를 Vision Encoder(보통 ViT — Vision Transformer)로 임베딩 벡터로 변환하고, 이를 LLM의 텍스트 토큰과 함께 처리합니다. Projection Layer(선형 변환 또는 Q-Former)가 시각 임베딩을 LLM의 텍스트 공간에 맞춥니다. GPT-4V, Claude 3 Vision, Gemini, LLaVA 등이 대표적입니다. OCR, 차트 해석, 의료 영상 분석, 코드 스크린샷 이해 등 다양한 시각적 태스크가 가능해졌습니다.
핵심 개념
1
이미지를 Vision Encoder(ViT)에 입력 → 패치별 임베딩 벡터 생성
2
Projection Layer가 시각 임베딩을 LLM의 텍스트 임베딩 공간으로 변환
3
변환된 이미지 토큰 + 텍스트 토큰을 LLM에 함께 입력
4
LLM의 Self-Attention이 이미지 토큰과 텍스트 토큰의 관계를 학습
5
Cross-modal 이해: "이 이미지에서 고양이는 어디에 있나요?" → 시각+언어 통합 추론
6
LLM이 텍스트 응답 생성 (이미지 설명, 질문 답변, 분석 등)
장점
- ✓ 이미지+텍스트 복합 태스크 처리
- ✓ 별도 OCR 없이 텍스트 인식
- ✓ 차트/그래프/다이어그램 이해
- ✓ 멀티모달 Agent의 기반
단점
- ✗ 환각 — 이미지에 없는 내용 생성
- ✗ 이미지 해상도/토큰 수 제한
- ✗ 미세한 시각적 차이 인식 어려움
- ✗ 학습 데이터의 시각적 편향
사용 사례
GPT-4V / GPT-4o (OpenAI)
Claude 3 Vision (Anthropic)
Gemini (Google)
의료 영상 분석
문서/차트 이해 (OCR + 추론)