DeepSeekが画像認識に対応した「DeepSeek-V4-Flash-Vision-Exp」をオープンモデルとして公開、画像認識を含むタスクでClaude Opus 4.8と同等の性能

中国企業のDeepSeekが「DeepSeek-V4-Flash-Vision-Exp」をオープンモデルとして公開しました。DeepSeek-V4-Flash-Vision-ExphはDeepSeek-V4シリーズとして初めて画像の入力に対応したマルチモーダルモデルで、画像認識を含むタスクでClaude Opus 4.8と同等のベンチマークスコアを記録しています。
DeepSeek-V4 can see now. 👀 DeepSeek-V4-Flash-Vision-Exp is the family’s first experimental multimodal model. MIT License.
🤖 https://t.co/U8mYcNGHqV
🏆 Beats Opus-4.8 on Agents’ Last Exam and ZeroBench, and trails it by just 0.7 on Chartography.
🖼️ Understands images,… pic.twitter.com/KfEUyopFFP— ModelScope (@ModelScope2022) August 31, 2026
DeepSeek-V4-Flash-Vision-Expはパラメーター数3050億のマルチモーダルモデルです。DeepSeek-V4-Flashのアーキテクチャをベースに画像処理モジュールを組み込み、事後学習によって画像認識能力が追加されています。
「DeepSeek-V4-Flash-Vision-Exp」「DeepSeek-V4-Flash-0731」「Claude Opus 4.8」のベンチマークスコアが以下。DeepSeek-V4-Flash-Vision-ExpはDeepSeek-V4-Flash-0731と同等以上のテキスト処理性能を維持しつつ、画像認識機能を追加することに成功し、画像認識タスクを含むテストではClaude Opus 4.8と同等のスコアを記録しました。

DeepSeek-V4-Flash-Vision-Expはオープンモデルとして公開されており、Hugging FaceとModelScopeからダウンロード可能です。ライセンスはMIT Licenseを採用しています。
deepseek-ai/DeepSeek-V4-Flash-Vision-Exp · Hugging Face
https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-Vision-Exp

DeepSeek-V4-Flash-Vision-Exp · 模型库
https://modelscope.cn/models/deepseek-ai/DeepSeek-V4-Flash-Vision-Exp

DeepSeek-V4-Flash-Vision-ExpはAPI経由でも利用可能。サポートされている画像形式は「JPEG」「PNG」「GIF」「WebP」の4種類です。入力画像の最大解像度は長辺8192ピクセルで、15枚以上の画像を入力する場合は長辺4096ピクセルまでに制限されます。また、大きな画像はアスペクト比を保ったまま800×800ピクセル相当にリサイズされるため、大きな画像を入力しても画像1枚当たりのトークン数は最大384トークン程度となります。APIのドキュメントは以下のリンク先で公開されています。
Vision | DeepSeek API Docs
https://api-docs.deepseek.com/guides/vision

DeepSeekのAPI料金はピーク時とオフピーク時で変化する仕組みです。ピーク時は「協定世界時で月曜日~金曜日の1時~4時および6時~10時」で、ピーク時のDeepSeek-V4-Flash-Vision-Expの100万トークン当たりの料金は入力0.44ドル(約70.55円)・キャッシュ済み入力0.014ドル(約2.24円)・出力1.32ドル(約211.65円)です。オフピーク時の料金はピーク時の半額です。
