※本ページはプロモーションが含まれています※
Grok 4.6は、公開された比較ではGPT-5.6 Solと総合指標で並び、知識作業系の評価で強い結果を示しました。ただし、コード修正やターミナル作業では競合が上回る指標もあります。また、「常に競合の半額以下」ではありません。GPT-5.6 Solの現行価格は当初の比較資料より下がっており、Gemini 2.5 Proは短い入力の料金がGrok 4.6より安いためです。出典:xAI「Introducing Grok 4.6」/OpenAIモデル仕様/Google Cloud料金表Grok 4.6と主要AIモデルのスペック比較
Grok 4.6は2026年8月12日に発表されました。ここではユーザーが比較しやすいよう、Grok 4.6、GPT-5.6 Sol、Claude Fable 5、Claude Opus 5、Gemini 2.5 Proのモデル単体のAPI仕様を並べます。画像生成ツールなどを組み合わせたサービス全体の機能と、モデルが直接受け付ける入出力は混同していません。出典:xAI発表
| 項目 | Grok 4.6 | GPT-5.6 Sol | Claude Fable 5 | Claude Opus 5 | Gemini 2.5 Pro |
|---|---|---|---|---|---|
| 開発元 | xAI | OpenAI | Anthropic | Anthropic | |
| コンテキスト上限 | 50万トークン | 105万トークン | 100万トークン | 100万トークン | 1,048,576トークン |
| モデルの入出力 | テキスト・画像入力/テキスト出力 | テキスト・画像入力/テキスト出力 | テキスト・画像入力/テキスト出力 | テキスト・画像入力/テキスト出力 | テキスト・画像・動画・音声・PDF入力/テキスト出力 |
| 入力/出力料金 | $2/$6 | $4/$20 | $10/$50 | $5/$25 | $1.25/$10 |
| 長い入力での料金変更 | 20万トークン以上のプロンプトで長文料金 | 27.2万入力トークン超で割増 | 通常料金のまま100万まで | 通常料金のまま100万まで | 20万入力トークン超で長文料金 |
料金は原則として100万トークン当たりの米ドル建て標準料金。Gemini 2.5 Proは20万入力トークン以下の場合。キャッシュ、地域、優先処理などによる変動は除きます。出典:xAIモデル仕様・xAI料金表・OpenAIモデル仕様・Anthropic Fable 5仕様・Anthropic Opus 5仕様・Googleモデル仕様・Google Cloud料金表。
注意したいのは、コンテキスト上限と、安い単価が適用される範囲は別という点です。Grok 4.6は最大50万トークンを扱えますが、長いプロンプトには別料金が設定されています。一方、Claudeの該当モデルについてAnthropicは100万トークンのコンテキストを標準料金で提供すると説明しています。長い資料を一度に投入する場合は、表面上の「$2/$6」だけで選ばないほうがよいでしょう。出典:xAI料金表/Anthropic長文料金
Grok 4.6のベンチマーク比較:知識作業は強いが、開発作業は一律に勝たない
ベンチマークは「何を測った数字か」をそろえて読む必要があります。以下はxAIがGrok 4.6発表時に掲載した比較値です。Grok 4.6はHigh、GPT-5.6 SolとClaude Fable 5はMaxの値であり、設定が完全に同一という意味ではありません。また、AA Intelligence Indexなどの数値は発表時点の評価を示すもので、後日の異なるバージョンのスコアと直接つなげて順位を決めるべきではありません。出典:xAI発表・Evals
| 評価項目 | Grok 4.6 High | GPT-5.6 Sol Max | Claude Fable 5 Max | 読み取り方 |
|---|---|---|---|---|
| AA Intelligence Index | 61 | 61 | 62 | 総合指標では近い |
| GDPVal-AA v2 | 1753 Elo | 1728 Elo | 1741 Elo | エージェント型の知識作業でGrokが高い |
| AA-Briefcase | 1577 Elo | 1502 Elo | 1574 Elo | 長時間の知識作業で競争力がある |
| Harvey LAB(Vals) | 15.8% | 2.5% | 11.3% | この法務系評価ではGrokが高い |
| CursorBench v3.2 | 69.9% | 67.2% | 70.5% | Fableがわずかに高い |
| DeepSWE v1.1 | 65.9% | 73% | 70% | ソフトウェア開発では競合が高い |
| FrontierCode v1.1 Extended | 61.3% | 60.6% | 63.6% | Fableが高い |
| APEX-Agents | 57.5% | 56.7% | 59.2% | Fableが高い |
| Terminal-Bench v3.0 | 26% | 34.6% | 34.1% | ターミナル作業では競合が高い |
出典:xAI「Introducing Grok 4.6」掲載のEvals。第三者モデルの値は、xAIによる説明では各社公表値または公開値を含みます。異なる評価環境や推論設定で得られた数値を、実利用での勝率と同一視しないでください。
「Grokはコーディングに弱い」とまとめるのも正確ではありません。CursorBenchでは競合に近く、FrontierCodeではGPT-5.6 Solをわずかに上回る一方、DeepSWEとTerminal-BenchではGPT-5.6 SolやFable 5に届きません。したがって、アプリの初期実装・知識を調べながらの開発と、大規模なコード修正・ターミナル操作では選択が変わります。出典:xAI発表・Evals
第三者のArtificial Analysisも、Grok 4.6のGDPVal-AA v2を1753 Elo、AA-Briefcaseを1577 Eloと報告しています。同記事ではAA-Briefcaseの平均作業ターンをGrok 4.6で約53、Claude Opus 5 Maxで約103としています。ただし、ターンが少ないことと、すべての仕事で完成品質が高いことは同義ではありません。節約効果は、実際の入力・出力トークン量と再実行回数まで含めて判断します。出典:Artificial Analysisによる分析
Grok 4.6 vs Gemini 2.5 Pro:推論・開発重視か、動画・音声・超長文重視か
Gemini 2.5 Proとの比較では、単純な「新しいモデルが全面的に上」という見方を避けるべきです。Googleの公式仕様ではGemini 2.5 Proは動画・音声・PDFを入力でき、入力上限は1,048,576トークンです。対してGrok 4.6の公式モデル仕様はテキスト・画像入力、50万トークンです。何を入力したいかによって、そもそも適したモデルが変わります。出典:Googleモデル仕様/xAIモデル仕様
| 比較ポイント | Grok 4.6 | Gemini 2.5 Pro |
|---|---|---|
| 一度に扱える入力 | 最大50万トークンのコンテキスト | 入力上限1,048,576トークン |
| 動画・音声の直接入力 | モデル仕様の対応入力に記載なし | 対応 |
| 20万トークン以下の通常API単価 | 入力$2/出力$6 | 入力$1.25/出力$10 |
| 20万トークン超の料金 | 入力$4/出力$12 | 入力$2.50/出力$15 |
| 選ぶ理由 | 知識作業の公開評価と、出力単価を重視 | 非常に長い入力、動画・音声・PDFの直接解析を重視 |
料金は100万トークン当たり。Geminiの料金はGoogle Cloud掲載のGemini 2.5 Pro料金、Grokの料金はxAI料金表。対応入力は両社のGoogle仕様・xAI仕様を参照。「記載なし」は、そのモデル単体について比較対象の公式仕様から確認できないという意味です。
Gemini 2.5 Proのほうが入力単価は低く、Grok 4.6のほうが出力単価は低いため、文章を大量に読み込ませて短く要約する仕事と、推論や成果物の出力が多い仕事とでは、料金上の有利さが逆転し得ます。なお、両モデルとも長いプロンプトでは別料金となります。「Geminiの出力は長文時に$20」という元情報は、確認したGoogle Cloud料金表のGemini 2.5 Proの欄とは一致せず、同表では$15です。出典:Google Cloud料金表
API料金を比較:大量運用では「単価」と「使用量」の両方が重要
次は、20万トークンを超えるプロンプトを送らず、合計で入力100万・出力25万トークンを利用した場合の概算です。入力は複数リクエストの合計とし、キャッシュ割引、ツール料金、税金などは含めません。計算式は「入力単価×1+出力単価×0.25」です。
| モデル | 入力分 | 出力分 | 概算合計 |
|---|---|---|---|
| Grok 4.6 | $2.00 | $1.50 | $3.50 |
| Gemini 2.5 Pro | $1.25 | $2.50 | $3.75 |
| GPT-5.6 Sol | $4.00 | $5.00 | $9.00 |
| Claude Opus 5 | $5.00 | $6.25 | $11.25 |
| Claude Fable 5 | $10.00 | $12.50 | $22.50 |
上表は各社の公開標準単価を使った同一トークン量での試算であり、実測のタスク単価や性能順位ではありません。単価の出典:xAI・Google Cloud・OpenAI・Anthropic。
この条件ならGrok 4.6が最も低額ですが、Gemini 2.5 Proとの差はわずか$0.25です。「GrokならGeminiの半額」という結論にはなりません。さらに、GPT-5.6 Solには現行の$4/$20というプロモーション価格が掲載されており、古い$5/$30をそのまま現在の比較表に流用すると差額を過大評価します。出典:OpenAIモデル仕様・料金
実際のエージェント運用では、モデルが何度もツールを呼び、過去の会話を再入力し、推論のための出力トークンを使う場合があります。したがって運用コストは、単価だけでなく、1件を終えるまでのターン数、入出力トークン数、失敗後のやり直しで比較するのが実践的です。xAIの料金表にはサーバー側ツールの追加料金も掲載されています。出典:xAI料金表
結局どれがおすすめ?用途別の選び方
おすすめは「総合ランキング1位」を決めることではなく、仕事の入力形式と、失敗したときのコストを先に決めることです。以下は公開仕様と掲載ベンチマークを踏まえた選び方であり、すべての企業環境で同じ結果を保証するものではありません。
| 重視する用途 | まず試す候補 | 判断理由と確認点 |
|---|---|---|
| 資料調査・分析・知識作業 | Grok 4.6 | GDPVal-AA v2とAA-Briefcaseの発表時評価が高い。自社資料でも成果物の品質を確認する。 |
| コード修正・ターミナル操作 | GPT-5.6 Sol/Claude Fable 5 | 掲載されたDeepSWE・Terminal-BenchではGrok 4.6より高い。実際のリポジトリで検証する。 |
| 高難度の長時間タスク | Claude Fable 5/Opus 5とGrok 4.6を比較 | 総合指標と作業別指標の両方を確認。価格より完成率を優先するか決める。 |
| 動画・音声・PDFを直接入力 | Gemini 2.5 Pro | 対象モデルの公式仕様でこれらの入力に対応。必要な出力形式も確認する。 |
| 大量のテキスト生成を低単価で運用 | Grok 4.6を起点に比較 | 通常時の出力単価は$6。20万トークン以上のプロンプトでは料金を再計算する。 |
判断の根拠:xAI公表ベンチマーク・Artificial Analysis・Googleモデル仕様・xAI料金表。
Grok 4.6比較でよくある質問
Q. Grok 4.6はGPT-5.6 Solより高性能ですか?
A. 一言では決められません。xAI掲載のAA Intelligence Indexでは両者とも61です。一方、GDPVal-AA v2とAA-BriefcaseではGrok 4.6、DeepSWE v1.1とTerminal-Bench v3.0ではGPT-5.6 Solの数値が高くなっています。「知識作業か、開発・ターミナル作業か」で判断してください。出典:xAI発表・Evals
Q. Grok 4.6の50万トークンは、Gemini 2.5 Proの約100万トークンより不利ですか?
A. 一度の入力に非常に長い資料を収めたいなら、上限が大きいGemini 2.5 Proは有力です。ただし、コンテキスト上限だけでは回答品質や総費用は決まりません。分割して処理できるか、長文料金がかかるか、必要な箇所を正しく参照できるかも合わせて試してください。出典:Googleモデル仕様/xAI料金表
Q. 2026年9月に比較するなら、これらが各社の最新モデルですか?
A. いいえ。この記事は指定されたモデル同士の比較です。確認した資料には、Grok 4.7、GPT-6 Sol、Claude Fable 5.1、Claude Opus 5.5などの後続モデルも掲載されています。新規導入を決める場合は、それらの現行仕様・料金も別途比較してください。特にAnthropicのモデル案内は、一般的な用途ではClaude Opus 5.5から検討し、より厳しい推論や長時間作業ではClaude Fable 5.1を検討するよう案内しています。この記事の旧モデル比較を、現行モデルの推奨順位に読み替えることはできません。出典:xAI料金表/OpenAI発表/Anthropicモデル一覧
まとめ:Grok 4.6は「安いから一択」ではなく、知識作業で試す価値が高い
Grok 4.6は、発表時の総合指標でGPT-5.6 Solと並び、知識作業の公開評価でも強い結果を示しました。通常の出力単価は$6と、この記事で取り上げたGPT-5.6 SolやClaude Fable 5・Opus 5より低額です。一方、DeepSWEやTerminal-Benchでは競合が上回り、Gemini 2.5 Proには約100万トークンの入力枠と動画・音声への対応があります。出典:xAI発表/Googleモデル仕様
選ぶ際は、同じ資料や同じ開発タスクを複数モデルに渡し、完成品質・作業時間・再試行回数・実際の請求額を記録するのが確実です。Grok 4.6を知識作業の第一候補にしつつ、複雑なコード修正にはGPT-5.6 SolやClaude、動画・音声を含む長い資料にはGemini 2.5 Proを比較対象にする――それが、公開データを過大解釈しない現実的な使い分けです。


コメント