中国企業のDeepSeekが「DeepSeek-V4-Flash-Vision-Exp」をオープンモデルとして公開しました。DeepSeek-V4-Flash-Vision-ExphはDeepSeek-V4シリーズとして初めて画像の入力に対応したマルチモーダルモデルで、画像認識を含むタスクでClaude Opus 4.8と同等のベンチマークスコアを記録しています。





DeepSeek-V4-Flash-Vision-Expはパラメーター数3050億のマルチモーダルモデルです。DeepSeek-V4-Flashのアーキテクチャをベースに画像処理モジュールを組み込み、事後学習によって画像認識能力が追加されています。

「DeepSeek-V4-Flash-Vision-Exp」「DeepSeek-V4-Flash-0731」「Claude Opus 4.8」のベンチマークスコアが以下。DeepSeek-V4-Flash-Vision-ExpはDeepSeek-V4-Flash-0731と同等以上のテキスト処理性能を維持しつつ、画像認識機能を追加することに成功し、画像認識タスクを含むテストではClaude Opus 4.8と同等のスコアを記録しました。



DeepSeek-V4-Flash-Vision-Expはオープンモデルとして公開されており、Hugging FaceとModelScopeからダウンロード可能です。ライセンスはMIT Licenseを採用しています。

deepseek-ai/DeepSeek-V4-Flash-Vision-Exp · Hugging Face

https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-Vision-Exp



DeepSeek-V4-Flash-Vision-Exp · 模型库

https://modelscope.cn/models/deepseek-ai/DeepSeek-V4-Flash-Vision-Exp



DeepSeek-V4-Flash-Vision-ExpはAPI経由でも利用可能。サポートされている画像形式は「JPEG」「PNG」「GIF」「WebP」の4種類です。入力画像の最大解像度は長辺8192ピクセルで、15枚以上の画像を入力する場合は長辺4096ピクセルまでに制限されます。また、大きな画像はアスペクト比を保ったまま800×800ピクセル相当にリサイズされるため、大きな画像を入力しても画像1枚当たりのトークン数は最大384トークン程度となります。APIのドキュメントは以下のリンク先で公開されています。

Vision | DeepSeek API Docs

https://api-docs.deepseek.com/guides/vision



DeepSeekのAPI料金はピーク時とオフピーク時で変化する仕組みです。ピーク時は「協定世界時で月曜日~金曜日の1時~4時および6時~10時」で、ピーク時のDeepSeek-V4-Flash-Vision-Expの100万トークン当たりの料金は入力0.44ドル(約70.55円)・キャッシュ済み入力0.014ドル(約2.24円)・出力1.32ドル(約211.65円)です。オフピーク時の料金はピーク時の半額です。