← ブログに戻る
Ai読了目安 14 分

Step 5はバージョン番号を4つ飛ばしてオープンモデル2位に着地した。だが誰もAPIを叩いていない

公開日 2026年10月5日
Step 5はバージョン番号を4つ飛ばしてオープンモデル2位に着地した。だが誰もAPIを叩いていない

2026年9月末、中国のラボStepFunはStep 5 Previewを公開した。このバージョン番号は誤植ではない。この系統の前モデルはStep 3.7 Flashであり、同社は4シリーズを丸ごと飛び越えてここにたどり着いた。オープンソース版のリリースは10月15日に予定されており、モデルはすでにStepFunの製品とAPIを通じて利用できる。

スペックは一つの仕事に狙いを絞っている。Step 5 Previewは総パラメータ6,000億、アクティブ2,700億で、100万トークンのコンテキストをサポートし、テキストと画像の両方をネイティブに受け付ける。StepFunはこれを汎用チャットではなく、コーディング、ソフトウェアエンジニアリング、長期的なエージェントタスク向けに位置づけている。

Artificial Analysis Intelligence Indexでは44点。これはKimi K3とGrok 4.6と同水準で、GLM-5.3に1点及ばず、世界のオープンソースモデルの中で同率2位となる。3か月前、Step 3.7 Flashは同じ指数でおよそ19だった。

硬い光の下、暗い面の上でバランスを取る平たく粗い石の積み重ね

飛躍そのものは説明が簡単な部分だ

1回のリリースで25ポイントの上昇は信じがたいが、その下で何が変わったかを見れば納得がいく。Step 3.7 Flashはビジョン作業向けに作られた小型で高速なモデルだった。スクリーンショットや動画フレームの読み取りは得意だったが、コーディングツールに組み込んだ開発者たちの証言によれば、複雑な作業を任せるには力不足だった。Step 5 Previewは別格のモデルで、アクティベーション予算は約3倍、コンテキストウィンドウはコードベース全体を収めるサイズ、そして訓練はエージェント動作を明示的に狙っている。

中国のラボは2026年を通じてこの定石を繰り返してきた。高速な小型モデルを出し、何が壊れるかを学び、そのうえでフロンティアへの挑戦に計算資源を注ぎ込む。ここで異例なのは公表されたバージョン番号の算術であり、その算術はStepFunに有利に働く。Step 3.7 Flashを使ったことのある人はそれをStep 5 Previewと混同しないし、両者の隔たりはベンチマークの表がなくても改善を読み取れるようにしている。

独立系の初期テストは、ありふれた観察でその主張を裏付けている。モデルをコーディングエージェントに接続した開発者は、出力が安定しており、エンジニアリングコードが返ってきたときに必要な手直しサイクルが減ったと報告した。コーディングモデルにとって意味のある種類の称賛であり、地味なだけに信憑性がある。

本当の話は導入数のほうだ

ここからがこのリリースの面白いところだ。OpenRouterはモデルの呼び出し量の週次ランキングを公開しているが、Step 5 Previewはトップ10に入っていない。ベンチマークの順位も、コンテキストウィンドウも、オープンライセンスも持っているのに、最も活発なマルチモデルルーターで大量に呼び出されてはいない。

この乖離は、このモデル固有の失敗というより、中国のオープンウェイト系リリース全体に見られるパターンを表しているので、じっくり考える価値がある。ベンチマークの順位は、作り手がモデルを評価するために使うシグナルだ。呼び出し量は、使い手が実際に使うことで生み出すシグナルだ。この2つはこの1年、ずっと乖離し続けている。

説明の一部は構造的なものだ。OpenRouterの量は、中国製モデルをホストすることが調達やコンプライアンス上の疑問を伴う市場の開発者と、チームが最初に選んだものにすでに統合されているワークロードによって支配されている。モデルが無料でもスイッチングコストは現実に存在する。統合作業は無料ではないからだ。スイッチングコストが知覚される利得を上回れば、モデルが優れていても負けることがある。

もう一部は流通の問題だ。StepFunはGoogleやMetaではなく、開発者を自社エンドポイントへ誘導するチャネルを持っていない。10月15日のオープンソースリリースは、どんなベンチマークよりも多くを語るだろう。誰でもダウンロードしてローカルで動かせる重みは、ホストに関する疑問を完全に迂回するからだ。それはモデルが採用されるためにベンダーとの関係を必要としなくなる瞬間だ。

中国のラボが解決に手間取ってきた、平易な言葉の問題もある。Step 5 Previewを試す西欧の開発者は誰でも、まず国内向けに書かれたAPIコンソール、ドキュメント、エラーメッセージを読み解かなければならない。指数で首位に1点差のモデルが、最初のリクエストでは15分遅れることがあり、採用が実際に決まるのはその最初のリクエストの場だ。

ローカル実行の道筋が変えうるもの

オープンウェイトのリリースは、この話の中で最も上振れ余地のある部分だ。なぜそう言えるのかを具体的に述べておく価値がある。

重みをダウンロードできる開発者は、二つの障害を同時に取り除く。確立すべきベンダー関係はなく、推論がどこで行われ、データが誰の管轄をまたぐかという疑問もない。中国製モデルと自国製モデルを天秤にかける欧州や北米のチームにとって、その差は脚注ではなく多くの場合決め手になる。他国のホスト型エンドポイントを決して呼び出さない企業の内部にLlamaやQwenの派生モデルが現れるのも同じ理由だ。

落とし穴は、オープンウェイトがコストをトークン課金からハードウェアと運用へ移すことだ。アクティブ2,700億の6,000億パラメータモデルはワークステーションでは動かない。ホスト型エンドポイントをコストで上回る水準で提供するには、エンタープライズ向けGPUか、攻めの量子化ビルドのどちらかが必要で、量子化ビルドはラボではなくコミュニティから出てくる。モデルが大半のチームにとって実際に使えるようになる時期を決めるのは、ライセンスの日付ではなく、このタイムラインだ。

StepFunのリリーススケジュールは、同社がこれを理解していることを示唆している。重みが公開されるのは10月15日だが、モデルは9月末から自社APIで利用可能だ。この間隔は、人々が実際に検証できるバージョンが公開される前に、ラボが1か月分の本番フィードバックを取り込む時間を与える。

これがオープンウェイト市場について語ること

Step 5 Previewは、過去1年で競争の軸が変わった混雑した市場に登場する。2026年初頭、問われていたのはどのモデルがリーダーボードの頂点に立つかだった。秋になると、採用を決める問いはもっと実務的なものへと変わっていた。ライセンスは何を許すのか、どのチップベンダーがツールチェーンを対応させたか、ファインチューニングのスタックはどれだけ揃っているか、その周りのコミュニティはどれだけ活発か。

この変化は、今日モデルを選ぶ誰にとっても重要だ。ベンチマークで首位でも、明確なデプロイ経路も量子化ビルドもなく、コミュニティも薄いモデルは、少し弱くても動くツールがあるモデルより統合時間のコストが高くつく。ベンチマークはモデルが何をできるかを教えてくれる。エコシステムは、それを知るのにいくらかかるかを教えてくれる。

StepFunの賭けは、能力の飛躍が注目を集め、10月15日のオープンウェイトリリースがその注目の一部を利用に変えるというもののようだ。妥当な賭けであり、同時に定番でもある。2026年の中国のフロンティアリリースはほぼすべて同じ弧を描いてきた。強いベンチマーク順位、オープンウェイト、国内チップベンダーによる一連の対応、そして週次の呼び出し量が実際に動いたかをめぐる静かな疑問。

Step 5 Previewで本当に注目すべきは、仕様の規律だ。100万トークンのコンテキスト、エージェント訓練、アクティブ2,700億のパラメータ予算は、汎用の候補ではなくエンジニアリング作業のための首尾一貫した製品だ。StepFunは4つのバージョン番号を飛ばし、タスクリストで背伸びをしなかった。開発者がそれに気づくかどうかは別問題で、答えはレビューではなく呼び出し量に現れる。

関連記事