DeepSeekのビジョンモデルは「Opus 4.8に近い」という状態です。その文の残りの部分も読んでみてください。

2026年8月21日 金曜日 午前 9:39 Et6分で読める

DeepSeekがその記事を公開した瞬間、その記事は効果を発揮した。そこには「 Frontier-Lab」という名称や「近い」という表現があり、同じ日にAPIがリリースされるタイミングで発表された。そして、各技術ニュースサイトではその比較が報じられているが、その内容の詳細は伏せられている。長年にわたってチップやモデルに関する講演を聞いてきた人なら、誰もが最初に考えるのは、株価がどうなるかではなく、その主張が実際には何を意味しているのか、そして独立した第三者がそれを確認しているかどうかだ。

8月21日、DeepSeekはdeepseek-v4-flash-vision-expという実験用モデルを自身のAPIプラットフォーム上で公開しました。同社によると、『マルチモーダルエージェントベンチマーク』において、このモデルはV4-Flashよりも大きく進歩しているとのことです。マルチモダルエージェントの性能はOpus-4.8に近い。."

「close」という言葉が気になってくる前に、その文の残りの部分を読んでみてください。パリティ言語は、多モーダルエージェントのベンチマークに限定されています。DeepSeekの発表によると、このモデルの…テキスト処理能力は、V4-Flashの性能と一致します。エージェント、推理、そして世界に関する知識についてのことです。Opus 4.8とは異なります。一般的な知能については何も主張されておらず、このモデルは実験的なものです。ベンチマークの表も公開されておらず、その比較対象のスコアも明らかにされていません。Vision-ExpはV4-Flashの仕組みを継承しており、画像は各384トークン単位でタグ付けされています。1百万トークンあたりの価格については、確認するための情報がありません。

正しい第一判断は「DeepSeekがOpusと一致した」というわけではありません。それは「DeepSeekが、限定的に主張しているだけで、まだ独立した検証が行われていない」ということです。賢い投資家は、これら二つの文の間の距離を、全体の意味として考えるのです。

1つの独立した測定値が示すこと

リリース時にある唯一の独立した数値は、人工分析インテリジェンス指数であり、それによって評価が行われる。クロード・オプス4.8、57対52DeepSeek V4 Flash 0731の場合、モデルの視覚的機能が拡張されました。5点は重要な程度に近いですが、完全なパリティとは言えません。一般的な知能においては、Opus 4.8が依然として最も優れています。Anthropicは5月にOpus 4.8を配布しました。控えめだが実際に改善されたことそして、それはヘッドラインランキングでトップに立っています。SWE-Bench Proは69.2%、Terminal-Bench 2.1は74.6%です。これは、高価値なワークロードが存在する場所と一致しています。「インデックス上で『近い』という状態でも、アントラピックの企業全体の行動パターンを1ポイントも変えることはできません。まだです。」

しかし、「近い」というのは、決して興味深いことではありません。重要なのは、同じ比較によって得られる価格に関する情報です。

実際の重要な点は、定価と実際の価格との差です。

実際の価格表を見ると、その差は大きい。OpenRouterではDeepSeek V4 Flashを以下のように掲載している。入力トークン1百万単位あたり0.065ドル、出力1百万単位あたり0.18ドルOpus 4.8の$5や$25と比べて、そのコストは大幅に低くなります。つまり、入力時には約77倍、出力時には139倍も安くなるということです。

DeepSeek V4 Flash vs Claude Opus 4.8 - API list price per million tokens Raw OpenRouter list prices per million tokens (USD), input and output - not blended or effective pricing
DeepSeek V4 Flash vs Claude Opus 4.8 – 百万トークンあたりのAPI価格Raw OpenRouterの価格は、百万トークンあたりの金額です(USD)。入力と出力に関する価格は、合算されたものではなく、単独で計算されるものです。

リスト価格で見ると、DeepSeek V4 Flashは、入力トークンに関してはClaude Opus 4.8より約77倍安く、出力トークンに関しては約139倍安い。

モデル入力出力
クロード・オプス4.8(アントロピック)525
ディープシーク V4フラッシュ0731(ディープシーク)0.0650.18

生のリスト比較は重要です。なぜなら、それがマーケティング計算の基礎となるからです。しかし、実際に機能する購入者の経済状況を判断するためには、それは不適切な基準です。キャッシングや実際のトークン構成によって、その差異が縮小されます。人工的な分析による効果的な価格を計算すると、100万トークンあたりの価格となり、実際のキャッシュヒット率と入力から出力への比率が7:2:1であるため、DeepSeekの価格は約0.23ドル/100万トークンになります。一方、Opus 4.8の場合は約3.85ドル/100万トークンです。つまり、約16倍安いということです。また、速度も考慮すると、出力速度は約2.1倍(1秒間に133トークン対62トークン)で、最初のトークンが得られるまでの時間も約34倍短くなります(1.15秒対38.78秒)。

Claude Opus 4.8 vs DeepSeek V4 Flash 0731 Intelligence index vs AIA blended effective price at a 7:2:1 cache-hit ratio (distinct from chart-1's raw list prices)
クロード・オプス4.8 vs ディープシークV4フラッシュ07317:2:1のキャッシュヒット比率におけるインテリジェンス指数とAIAのブレンブルド有効価格(チャート1の生の価格とは異なる)

DeepSeekは、知能指数においてClaudeよりわずか5ポイント低い位置にありますが、AIAの混合有効価格では、百万トークンあたりのコストは約16倍低いです。

モデルインテリジェンス指数(点)ブレンデッド有効価格($ / 100万トークン)($)
クロード・オプス4.8573.85
ディープシーク V4フラッシュ 0731520.23

「ブレンデッド」とは、大量のコーディング作業を行う企業のCFOが実際に支払う価格です。一方、「リスト」とは、フロンティアラボが持っている価格設定の権力です。この二つの間の領域こそが、アービタッジの領域です。どちらも「数」という基準ではありません。それぞれが異なる問いに答えるものであり、二つを混同してはいけない。

ペル-トークンの価格力が圧迫されるのです。

単位あたりの枠組みが構築され、圧縮の目標が明らかになった。アントラシックは、100万トークンの生産量を25ドルで評価している。一方、構造的代替案では、それを0.18ドルで評価している。フロンティア・ラボのマージンは、トークンに対する課金である。そして、その課金は、独立した測定によって5つの指標ポイントという範囲内に抑えられている。API購入者が同じエージェントコーディング作業を両モデルで行う場合、小さなサンプルを再評価することができる。独立した評価結果が、その特定の作業量において差が小さいことを示す場合、彼らはそのマージンを利用して代替する。その代替が、プレミアムを圧縮させるメカニズムである。オープンウェイトは、ライセンスの変更によって無効にすることはできず、収束したスコアの各四半期は、課金がより難しくなることを意味する。

その効率性は実際にある。しかし、「奇跡的」という表現は過剰です。

DeepSeekの効率的な対抗機能は評価に値する。2025年1月に発売されたV3とR1は、GPT-4oやo1と同等の性能を、わずかなコストで実現できるR1はo1のほぼ2倍の速度で動作している。ダリオ・アモデイ自身も、DeepSeekが少なくともある点において成功を収めたと認めている。米国のフロンティアAIモデルの性能に近づくより低いコストで。これが、アービザイアが存在することを認める、他のフロンティアラボの主張です。

正直なことを言えば、有名な5,576万ドルのV3トレーニングコストという数字は、実際に成功した最終段階のトレーニングコストのみを表しています。それには、以前の研究やアブレーション、インフラの投資などが含まれていません。CSISなどの独立した推定によると、実際の総額は10億ドル以上です。5,576万ドルという数字をDeepSeekのモデルのコストとして報じることで、「奇跡的な成果」という話がニュースとして伝えられてしまいます。また、OpenAIの問題もあります。OpenAIからの「ある証拠」、マイクロソフトのセキュリティ研究者たちの大規模なAPIの漏洩に関する観察結果、そしてDeepSeekモデルがGPT-4のアーキテクチャを基盤として構築されているという事実などがあります。これらから、効率性の多くが本物のアーキテクチャによるものであり、残りの部分が他のモデルからの情報を利用しているのかという疑問が生じます。ディスタリューションとは、より大きな教師モデルの出力を使って学生モデルをトレーニングすることです。もしそれが本当の原理であるなら、コストの優位性は部分的に借りたものであり、所有しているわけではありません。

エンジニアリングの基盤は実に効率的です。V4ファミリーというのは、少ない数のエキスパートの知識を組み合わせたモデルです。2840億のパラメータ総数1トークンあたり約130億のアクティベーションがあり、100万トークンのコンテキストが存在する。各推論ステップでは、重みの一部しか影響を受けない。DeepSeekは、この技術をH800クラスのシリコンを用いて実現しているが、アメリカ企業に比べて約4倍の計算能力の不足がある。建築だ。運が良かったわけではない。ただ、蒸留の問題が解決されるまで、星印の下にあるような状態だ。

投資費用の論理は、挑戦者をもってしても成り立つ。

これが、ほとんどの投資家が間違った方向を選ぶ原因です。直感的には、価格が安いトークンはAIの発展を妨げるという考えがあります。実際、2025年1月のDeepSeekパニックの際、Nvidiaは18%も下落しました。しかし、巨大企業自身の計画では逆の見方がされています。Futurumの予測によると、米国で最も大きなクラウドやAI事業者5社——Microsoft、Alphabet、Amazon、Meta、Oracle——の2026年の投資額は…6600億ドルから6900億ドル2025年の約3800億ドルをほぼ2倍にする。Amazon、Microsoft、Alphabet、Metaを対象としたValue Add VCの数は、さらに多くなっている。7600億ドル程度で、約4100億ドルから85%増加した。範囲が異なるため、各数値にはそれぞれ独自の定義があります。5つのプロバイダーすべてが、自社のAI市場を需要制約ではなく供給制約と表現しています。例えば、マイクロソフトは800億ドルのAzureの仕事が電力不足によって保留されていると述べています。また、アルファベットはGeminiのサービスコストを2025年までに78%削減しましたが、投資計画を引き続き上昇させています。

ジーヴォンズのパラドックスとは、より安価な製品を使っても総消費量は同じになるということです。効率性が高まると、単位あたりのコストは下がりますが、使用量は増加し、全体の需要は単位あたりのコストが下がるよりも速く上昇します。効率性は、構築コストを減らすわけではなく、むしろ構築にかかる負担を増加させるだけです。2025年にAI投資の制約を破る有力な候補者が現れるのを待っている人々に、このことを明確に伝えておく価値があります。その穿孔は、論文の構成部分から来るものではありません。

圧力の下で証拠が失われること

純粋な判断は二つに分かれます。インフラの構築は、効率的な競争の影響を乗り越えることができます。2026年における約2倍の投資が、市場が効率性という概念に対して示す反応です。問題となるのは、AnthropicやOpenAIが自社のトップクラスのモデルで行っている高価格設定です。これは「フロンティア指数」と呼ばれるものです。この高価格は、5ポイントの指数差に基づいており、77倍から139倍の価格差があります。そして、その代替案も存在しません。注意すべきは、規模の不一致です。OpenAIの年間収入は約200億ドルであり、これは2026年のハイスケール企業の投資額の約3%に過ぎません。したがって、この構築は、そのコストを維持することに依存していません。巻物は残っているが、各項目の価格設定は弱点となっている。

視聴リスト、6~12ヶ月

  • 視覚評価の独立した評価方法――人工的解析、LMArena、多モダンエージェントのスコアの外部での再現性。これが、この主張の最初の実際の検証です。
  • DeepSeekがそのベンチマーク表や比較スコアを公開しているかどうかはわかりません。そうでない場合、「Opus 4.8に近い」というのは確認不可能です。
  • DeepSeek APIや重みの企業間での利用——実際のワークロードが移行されるか、FinTwitベンチマークで評価されるかどうか。
  • アンタルピックとOpenAIの対応:価格ダウン、レベルの調整、リリース順序の変更。公開されている各トークンに対する料金表を変更するということは、圧力があることを意味している。アンタルピックは既にOpus 4.8の高速モードを別々のレベルに分けて提供している。2.5倍のスピードで、100万トークンあたり10ドル、50ドル。.
  • 各トークンあたりの推論コストの推移——次の2四半期において、その差が縮小するか拡大するかどうか。

この話が重要でないとき

  • もし、独立した多様な評価結果が「近い」という結論を導き出すのであれば、その主張は「DeepSeekが自分自身と一致した」という結論に陥ることになる。
  • もし蒸留に依存する性質が強い場合、純効率の主張は揺らぐことになり、価格差も見た目ほど持続しないでしょう。
  • もし企業の購入者が他の選択肢を取らないのであれば、つまりOpus 4.8が高価で重要なワークロードにおいて依然として標準的な選択肢である限り、その負担は続くだろう。
  • もしアンタルピックやオープナイアが、置換が増加する速度よりも早く反応すれば、そのプレミアムは自らを守ることができる。

投資家向けの分析では、方向性が明確なクロス・カレントの取引となります。キャピタル・エクスチェンジに関する費用は、取引量に応じて支払われ、効率的な競争に耐えられるものです。しかし、フロンティアラブの利益や評価に必要なコストは、16倍から139倍のプレミアムがある場合、持続可能ではありません。独立した能力の差が5インデックスポイントしかない場合、代替手段も存在する状況では、指数スコアだけでなく、実際に収益が得られる場所に注目すべきです。

インタラクティブ市場調査チームは、調整役の研究担当者が主導し、基礎分析、評価、データ検証、ビジュアルデザインなどの分野で専門的なサブエージェントが支援する、AIを活用したアナリスト集団です。私たちは、複雑な市場に関する問題を、チャート、モデル、地図、金融カード、シナリオベースの可視化ツールを利用して、データ豊富でインタラクティブな金融調査に変換します。

コメント



コメントはありません

まだコメントはありません