SpaceXAI が次期フラッグシップ「Grok 4.7」を9月中旬に投入する見込みです。イーロン・マスク氏が9月2日にXで「10日ほど先」と述べたもので、規模は約2.1兆パラメータ、現行のGrok 4.6から4割ほど大きくなるとされています。ロケットや衛星の設計データを追加学習に使ったという説明も付いていますが、開発者向けドキュメントにはまだモデルIDも価格も載っていません。

「10日ほど先」とだけ語られた投入時期

投入時期の根拠は、マスク氏がXに書いた「10日ほど先」という一言です。9月2日の発言なので、素直に数えると9月11日か12日あたりになります。日付を切ったプレスリリースが出たわけではなく、現時点で確定しているのはこの発言だけです。

直前の世代からの間隔は短めです。Grok 4.5が7月、Grok 4.6が8月12日で、そこから1か月ほどで次が来る計算になります。エージェント用途の競争が激しくなるなかで、更新間隔を詰めてきた形です。

一方で、開発者向けドキュメントの最終更新は8月21日のままで、モデル一覧の最新は grok-4.6 です。grok-4.7 のモデルIDも、価格も、コンテキスト長も、ベンチマークカードも公開されていません。現段階で手元の実装に組み込める情報は、まだ何も出ていないと考えてよい状態です。

2.1兆パラメータをどう受け取るか

規模の話は分かりやすい反面、扱いには注意が要ります。マスク氏の説明では、Grok 4.6が約1.5兆パラメータ、Grok 4.7が約2.1兆パラメータで、差は4割ほどです。

ただし、この数字だけでは 実際に動くパラメータ が分かりません。専門家混合(MoE)のような構造では、総パラメータ数と1トークンあたりに実際に使われるパラメータ数は別物になります。有効パラメータ、スパース性、エキスパートの振り分け方、推論コストといった内訳は今のところ示されていません。

パラメータ数が性能を直線的に決めるわけでもありません。アーキテクチャの設計、学習データの質、事後学習の作り込み、推論時の効率化がそれぞれ効いてきます。規模が4割増えたからといって、体感が4割良くなると考えるのは早計です。

SpaceXの設計データという賭け

もう1つの目玉が学習データです。補助的な学習フェーズで、SpaceXのエンジニアリング記録、テレメトリ、社内文書、Starlink衛星のデータを投入したと説明されています。

ここは同社の立ち位置と地続きです。Grokを開発しているのはSpaceXAI LLCで、ブランドガイドラインでは X(旧Twitter)とは別会社である点が明記されています。ロケットと衛星の運用で積み上がった実機のデータを、言語モデルの学習に回せる企業はそう多くありません。

狙いとしては、テキスト中心で学習したモデルとは違う形で、現実の工学的な問題に効くのではないかという期待があります。ただし、この前提が大規模に検証された例はまだありません。設計データを足せば設計が上手くなるという話は、直感的ではあっても実証は別問題です。

マスク氏自身は、Grok 4.7がGrok 4.6をあらゆる面で上回り、トークン効率も改善すると述べています。同時に、規模が大きくなる分だけ推論速度はやや落ちる可能性にも触れています。

比較対象になる Grok 4.6 の現在地

次が出るときに基準になるのは、8月12日に公開されたGrok 4.6です。コンテキストは50万トークン、API価格は入力が100万トークンあたり2ドル(約310円)、出力が6ドル(約940円)で、高速版はその2倍という設定になっています。知識のカットオフは2026年2月1日です。

※1ドル156円換算(2026年9月5日時点)

公式に示された評価では、9つのベンチマークを合成したArtificial Analysis Intelligence Indexで61を記録し、GPT-5.6 Sol Maxと並びました。Fable 5 Maxは62です。個別に見ると、GDPVal-AA v2で1753、CursorBench v3.2で69.9パーセント、DeepSWE v1.1で65.9パーセント、Terminal-Bench v3.0で26パーセントとなっており、項目によっては他社モデルが明確に上回っています。長く走らせるエージェント用途に寄せた世代で、Cursor、Grok Build、API、OpenRouter、Vercel、Cloudflareから使えます。

Grok 4.7が「あらゆる面で上回る」のであれば、これらの数字がどこまで動くかが評価の分かれ目になります。

数字が出そろうまでは保留が要る

過去の経緯も見ておく価値があります。Grok 4.6の公開時にも、完全なベンチマークがすぐには揃わなかったという指摘が出ていました。Grok 4.7が同じ形で出てくるなら、「すべてのモデルを上回る」という表現は当面マーケティングの側に置いておくのが妥当です。

導入を検討する側が見るべき数字ははっきりしています。有効パラメータ数、コンテキスト長、入出力の価格、そして第三者が再現できるベンチマークの4点です。ここが埋まって初めて、既存のワークフローを差し替える判断ができます。

まとめ

Grok 4.7は9月中旬の投入が見込まれ、規模は約2.1兆パラメータ、Grok 4.6から4割ほど大きくなるとされています。SpaceXのエンジニアリングデータを補助学習に使った点が特徴として語られる一方、有効パラメータ、価格、コンテキスト長、第三者検証済みのベンチマークはいずれも未公開です。開発者向けドキュメントの最新も grok-4.6 のままで、現時点で確かなのは投入時期の目安と規模の主張だけになります。数字が出てから評価するのが安全です。