DeepSeek、画像対応モデル「deepseek-v4-flash-vision-exp」公開
Judul asli: DeepSeek-v4-flash-vision-exp
Mengapa Ini Penting
中国発AIモデルがOpenAI互換のマルチモーダルAPIを提供し、開発者の選択肢が拡大する。
DeepSeekは、テキストと画像を同時に処理できるビジョンモデル「deepseek-v4-flash-vision-exp」をAPIドキュメントで公開した。JPEG、PNG、GIF、WebP形式をサポートする。
DeepSeekは、マルチモーダル対応モデル「deepseek-v4-flash-vision-exp」のAPIガイドを公式ドキュメントサイトで公開した。同モデルはテキストと画像を同時に入力として受け取り、画像の説明、スクリーンショットからのテキスト読み取り、グラフ分析などのタスクに対応する。
画像の入力方法は3種類用意されている。1つ目はBase64エンコード方式で、ローカルファイルをリクエストに直接埋め込む方法。リクエストボディの上限は48MiBとなる。2つ目は外部URLを指定する方式で、URLの最大長は8192文字、ファイルサイズは最大32MiB、ダウンロード完了まで60秒以内という制限がある。3つ目はFiles APIを使用する方式で、一度アップロードした画像をfile_idで参照でき、ファイルサイズは最大64MiBまで対応する。同モデルのAPIエンドポイントは「https://api.deepseek.com」で、OpenAI互換のChat Completions形式をサポートする。