👁️

Vision-Language Model

이미지와 텍스트를 함께 이해하는 AI

Vision-Language Model(VLM)은 시각 정보와 텍스트를 통합적으로 이해하는 AI입니다. 이미지를 Vision Encoder(보통 ViT — Vision Transformer)로 임베딩 벡터로 변환하고, 이를 LLM의 텍스트 토큰과 함께 처리합니다. Projection Layer(선형 변환 또는 Q-Former)가 시각 임베딩을 LLM의 텍스트 공간에 맞춥니다. GPT-4V, Claude 3 Vision, Gemini, LLaVA 등이 대표적입니다. OCR, 차트 해석, 의료 영상 분석, 코드 스크린샷 이해 등 다양한 시각적 태스크가 가능해졌습니다.

핵심 개념

1

이미지를 Vision Encoder(ViT)에 입력 → 패치별 임베딩 벡터 생성

2

Projection Layer가 시각 임베딩을 LLM의 텍스트 임베딩 공간으로 변환

3

변환된 이미지 토큰 + 텍스트 토큰을 LLM에 함께 입력

4

LLM의 Self-Attention이 이미지 토큰과 텍스트 토큰의 관계를 학습

5

Cross-modal 이해: "이 이미지에서 고양이는 어디에 있나요?" → 시각+언어 통합 추론

6

LLM이 텍스트 응답 생성 (이미지 설명, 질문 답변, 분석 등)

장점

  • 이미지+텍스트 복합 태스크 처리
  • 별도 OCR 없이 텍스트 인식
  • 차트/그래프/다이어그램 이해
  • 멀티모달 Agent의 기반

단점

  • 환각 — 이미지에 없는 내용 생성
  • 이미지 해상도/토큰 수 제한
  • 미세한 시각적 차이 인식 어려움
  • 학습 데이터의 시각적 편향

사용 사례

GPT-4V / GPT-4o (OpenAI) Claude 3 Vision (Anthropic) Gemini (Google) 의료 영상 분석 문서/차트 이해 (OCR + 추론)