DeepSeek, 비전 실험 모델 API 공개

원제: DeepSeek-v4-flash-vision-exp

왜 중요한가

DeepSeek가 비전 기능을 API로 공개하면서 멀티모달 AI 서비스 개발 및 OpenAI 대체 솔루션 수요에 직접 대응하게 된다.

DeepSeek는 이미지와 텍스트를 동시에 처리할 수 있는 비전 모델 'deepseek-v4-flash-vision-exp'를 API로 공개했다. JPEG, PNG, GIF, WebP 형식을 지원하며, OpenAI 호환 Chat Completions 형식을 채택했다. 이미지 입력 방법은 Base64 인코딩, 외부 URL, Files API 참조의 3가지 방식을 제공한다.

DeepSeek는 공식 API 문서를 통해 멀티모달 비전 모델 'deepseek-v4-flash-vision-exp'의 사용 가이드를 공개했다. 이 모델은 이미지와 텍스트를 함께 입력받아 사진 설명, 스크린샷 텍스트 읽기, 차트 분석 등의 작업을 수행할 수 있다.

지원 이미지 형식은 JPEG, PNG, GIF, WebP이며, 파일 이름이나 선언된 MIME 타입이 아닌 실제 파일 내용을 기반으로 형식을 감지한다.

이미지 전송 방식은 세 가지다. 첫째, Base64 인코딩 방식으로 이미지를 직접 요청에 포함하며, 48 MiB 요청 본문 한도가 적용된다. 둘째, 외부 이미지 URL을 통한 방식으로 URL은 최대 8,192자, 이미지 파일은 최대 32 MiB, 다운로드는 60초 이내에 완료되어야 한다. 셋째, Files API를 통해 미리 업로드한 이미지를 file_id로 참조하는 방식으로, 동일 이미지를 여러 요청에 재사용하거나 파일 크기가 큰 경우에 적합하며 최대 64 MiB까지 지원한다.

API 엔드포인트는 https://api.deepseek.com이며, OpenAI 호환 Chat Completions 형식과 Responses API 모두에서 동일한 세 가지 이미지 입력 방식을 사용할 수 있다.

출처

api-docs.deepseek.com — 원문 읽기 →