Grok 4.6は安い?GPT-5.6・Claude・Gemini 2.5 Proと料金・性能を比較

AI

※本ページはプロモーションが含まれています※

Grok 4.6は、公開された比較ではGPT-5.6 Solと総合指標で並び、知識作業系の評価で強い結果を示しました。ただし、コード修正やターミナル作業では競合が上回る指標もあります。また、「常に競合の半額以下」ではありません。GPT-5.6 Solの現行価格は当初の比較資料より下がっており、Gemini 2.5 Proは短い入力の料金がGrok 4.6より安いためです。出典:xAI「Introducing Grok 4.6」/OpenAIモデル仕様/Google Cloud料金表

Grok 4.6と主要AIモデルのスペック比較

Grok 4.6は2026年8月12日に発表されました。ここではユーザーが比較しやすいよう、Grok 4.6、GPT-5.6 Sol、Claude Fable 5、Claude Opus 5、Gemini 2.5 Proのモデル単体のAPI仕様を並べます。画像生成ツールなどを組み合わせたサービス全体の機能と、モデルが直接受け付ける入出力は混同していません。出典:xAI発表

比較表1:モデル単体の基本仕様と通常API料金
項目Grok 4.6GPT-5.6 SolClaude Fable 5Claude Opus 5Gemini 2.5 Pro
開発元xAIOpenAIAnthropicAnthropicGoogle
コンテキスト上限50万トークン105万トークン100万トークン100万トークン1,048,576トークン
モデルの入出力テキスト・画像入力/テキスト出力テキスト・画像入力/テキスト出力テキスト・画像入力/テキスト出力テキスト・画像入力/テキスト出力テキスト・画像・動画・音声・PDF入力/テキスト出力
入力/出力料金$2/$6$4/$20$10/$50$5/$25$1.25/$10
長い入力での料金変更20万トークン以上のプロンプトで長文料金27.2万入力トークン超で割増通常料金のまま100万まで通常料金のまま100万まで20万入力トークン超で長文料金

料金は原則として100万トークン当たりの米ドル建て標準料金。Gemini 2.5 Proは20万入力トークン以下の場合。キャッシュ、地域、優先処理などによる変動は除きます。出典:xAIモデル仕様・xAI料金表・OpenAIモデル仕様・Anthropic Fable 5仕様・Anthropic Opus 5仕様・Googleモデル仕様・Google Cloud料金表。

注意したいのは、コンテキスト上限と、安い単価が適用される範囲は別という点です。Grok 4.6は最大50万トークンを扱えますが、長いプロンプトには別料金が設定されています。一方、Claudeの該当モデルについてAnthropicは100万トークンのコンテキストを標準料金で提供すると説明しています。長い資料を一度に投入する場合は、表面上の「$2/$6」だけで選ばないほうがよいでしょう。出典:xAI料金表/Anthropic長文料金

Grok 4.6のベンチマーク比較:知識作業は強いが、開発作業は一律に勝たない

ベンチマークは「何を測った数字か」をそろえて読む必要があります。以下はxAIがGrok 4.6発表時に掲載した比較値です。Grok 4.6はHigh、GPT-5.6 SolとClaude Fable 5はMaxの値であり、設定が完全に同一という意味ではありません。また、AA Intelligence Indexなどの数値は発表時点の評価を示すもので、後日の異なるバージョンのスコアと直接つなげて順位を決めるべきではありません。出典:xAI発表・Evals

比較表2:Grok 4.6発表時にxAIが掲載した主要ベンチマーク
評価項目Grok 4.6 HighGPT-5.6 Sol MaxClaude Fable 5 Max読み取り方
AA Intelligence Index616162総合指標では近い
GDPVal-AA v21753 Elo1728 Elo1741 Eloエージェント型の知識作業でGrokが高い
AA-Briefcase1577 Elo1502 Elo1574 Elo長時間の知識作業で競争力がある
Harvey LAB(Vals)15.8%2.5%11.3%この法務系評価ではGrokが高い
CursorBench v3.269.9%67.2%70.5%Fableがわずかに高い
DeepSWE v1.165.9%73%70%ソフトウェア開発では競合が高い
FrontierCode v1.1 Extended61.3%60.6%63.6%Fableが高い
APEX-Agents57.5%56.7%59.2%Fableが高い
Terminal-Bench v3.026%34.6%34.1%ターミナル作業では競合が高い

出典:xAI「Introducing Grok 4.6」掲載のEvals。第三者モデルの値は、xAIによる説明では各社公表値または公開値を含みます。異なる評価環境や推論設定で得られた数値を、実利用での勝率と同一視しないでください。

「Grokはコーディングに弱い」とまとめるのも正確ではありません。CursorBenchでは競合に近く、FrontierCodeではGPT-5.6 Solをわずかに上回る一方、DeepSWEとTerminal-BenchではGPT-5.6 SolやFable 5に届きません。したがって、アプリの初期実装・知識を調べながらの開発と、大規模なコード修正・ターミナル操作では選択が変わります。出典:xAI発表・Evals

第三者のArtificial Analysisも、Grok 4.6のGDPVal-AA v2を1753 Elo、AA-Briefcaseを1577 Eloと報告しています。同記事ではAA-Briefcaseの平均作業ターンをGrok 4.6で約53、Claude Opus 5 Maxで約103としています。ただし、ターンが少ないことと、すべての仕事で完成品質が高いことは同義ではありません。節約効果は、実際の入力・出力トークン量と再実行回数まで含めて判断します。出典:Artificial Analysisによる分析

Grok 4.6 vs Gemini 2.5 Pro:推論・開発重視か、動画・音声・超長文重視か

Gemini 2.5 Proとの比較では、単純な「新しいモデルが全面的に上」という見方を避けるべきです。Googleの公式仕様ではGemini 2.5 Proは動画・音声・PDFを入力でき、入力上限は1,048,576トークンです。対してGrok 4.6の公式モデル仕様はテキスト・画像入力、50万トークンです。何を入力したいかによって、そもそも適したモデルが変わります。出典:Googleモデル仕様/xAIモデル仕様

比較表3:Grok 4.6とGemini 2.5 Proの実務上の違い
比較ポイントGrok 4.6Gemini 2.5 Pro
一度に扱える入力最大50万トークンのコンテキスト入力上限1,048,576トークン
動画・音声の直接入力モデル仕様の対応入力に記載なし対応
20万トークン以下の通常API単価入力$2/出力$6入力$1.25/出力$10
20万トークン超の料金入力$4/出力$12入力$2.50/出力$15
選ぶ理由知識作業の公開評価と、出力単価を重視非常に長い入力、動画・音声・PDFの直接解析を重視

料金は100万トークン当たり。Geminiの料金はGoogle Cloud掲載のGemini 2.5 Pro料金、Grokの料金はxAI料金表。対応入力は両社のGoogle仕様・xAI仕様を参照。「記載なし」は、そのモデル単体について比較対象の公式仕様から確認できないという意味です。

Gemini 2.5 Proのほうが入力単価は低く、Grok 4.6のほうが出力単価は低いため、文章を大量に読み込ませて短く要約する仕事と、推論や成果物の出力が多い仕事とでは、料金上の有利さが逆転し得ます。なお、両モデルとも長いプロンプトでは別料金となります。「Geminiの出力は長文時に$20」という元情報は、確認したGoogle Cloud料金表のGemini 2.5 Proの欄とは一致せず、同表では$15です。出典:Google Cloud料金表

API料金を比較:大量運用では「単価」と「使用量」の両方が重要

次は、20万トークンを超えるプロンプトを送らず、合計で入力100万・出力25万トークンを利用した場合の概算です。入力は複数リクエストの合計とし、キャッシュ割引、ツール料金、税金などは含めません。計算式は「入力単価×1+出力単価×0.25」です。

比較表4:入力100万・出力25万トークンの概算API料金
モデル入力分出力分概算合計
Grok 4.6$2.00$1.50$3.50
Gemini 2.5 Pro$1.25$2.50$3.75
GPT-5.6 Sol$4.00$5.00$9.00
Claude Opus 5$5.00$6.25$11.25
Claude Fable 5$10.00$12.50$22.50

上表は各社の公開標準単価を使った同一トークン量での試算であり、実測のタスク単価や性能順位ではありません。単価の出典:xAI・Google Cloud・OpenAI・Anthropic。

この条件ならGrok 4.6が最も低額ですが、Gemini 2.5 Proとの差はわずか$0.25です。「GrokならGeminiの半額」という結論にはなりません。さらに、GPT-5.6 Solには現行の$4/$20というプロモーション価格が掲載されており、古い$5/$30をそのまま現在の比較表に流用すると差額を過大評価します。出典:OpenAIモデル仕様・料金

実際のエージェント運用では、モデルが何度もツールを呼び、過去の会話を再入力し、推論のための出力トークンを使う場合があります。したがって運用コストは、単価だけでなく、1件を終えるまでのターン数、入出力トークン数、失敗後のやり直しで比較するのが実践的です。xAIの料金表にはサーバー側ツールの追加料金も掲載されています。出典:xAI料金表

結局どれがおすすめ?用途別の選び方

おすすめは「総合ランキング1位」を決めることではなく、仕事の入力形式と、失敗したときのコストを先に決めることです。以下は公開仕様と掲載ベンチマークを踏まえた選び方であり、すべての企業環境で同じ結果を保証するものではありません。

比較表5:用途別に見る候補モデル
重視する用途まず試す候補判断理由と確認点
資料調査・分析・知識作業Grok 4.6GDPVal-AA v2とAA-Briefcaseの発表時評価が高い。自社資料でも成果物の品質を確認する。
コード修正・ターミナル操作GPT-5.6 Sol/Claude Fable 5掲載されたDeepSWE・Terminal-BenchではGrok 4.6より高い。実際のリポジトリで検証する。
高難度の長時間タスクClaude Fable 5/Opus 5とGrok 4.6を比較総合指標と作業別指標の両方を確認。価格より完成率を優先するか決める。
動画・音声・PDFを直接入力Gemini 2.5 Pro対象モデルの公式仕様でこれらの入力に対応。必要な出力形式も確認する。
大量のテキスト生成を低単価で運用Grok 4.6を起点に比較通常時の出力単価は$6。20万トークン以上のプロンプトでは料金を再計算する。

判断の根拠:xAI公表ベンチマーク・Artificial Analysis・Googleモデル仕様・xAI料金表。

Grok 4.6比較でよくある質問

Q. Grok 4.6はGPT-5.6 Solより高性能ですか?

A. 一言では決められません。xAI掲載のAA Intelligence Indexでは両者とも61です。一方、GDPVal-AA v2とAA-BriefcaseではGrok 4.6、DeepSWE v1.1とTerminal-Bench v3.0ではGPT-5.6 Solの数値が高くなっています。「知識作業か、開発・ターミナル作業か」で判断してください。出典:xAI発表・Evals

Q. Grok 4.6の50万トークンは、Gemini 2.5 Proの約100万トークンより不利ですか?

A. 一度の入力に非常に長い資料を収めたいなら、上限が大きいGemini 2.5 Proは有力です。ただし、コンテキスト上限だけでは回答品質や総費用は決まりません。分割して処理できるか、長文料金がかかるか、必要な箇所を正しく参照できるかも合わせて試してください。出典:Googleモデル仕様/xAI料金表

Q. 2026年9月に比較するなら、これらが各社の最新モデルですか?

A. いいえ。この記事は指定されたモデル同士の比較です。確認した資料には、Grok 4.7、GPT-6 Sol、Claude Fable 5.1、Claude Opus 5.5などの後続モデルも掲載されています。新規導入を決める場合は、それらの現行仕様・料金も別途比較してください。特にAnthropicのモデル案内は、一般的な用途ではClaude Opus 5.5から検討し、より厳しい推論や長時間作業ではClaude Fable 5.1を検討するよう案内しています。この記事の旧モデル比較を、現行モデルの推奨順位に読み替えることはできません。出典:xAI料金表/OpenAI発表/Anthropicモデル一覧

まとめ:Grok 4.6は「安いから一択」ではなく、知識作業で試す価値が高い

Grok 4.6は、発表時の総合指標でGPT-5.6 Solと並び、知識作業の公開評価でも強い結果を示しました。通常の出力単価は$6と、この記事で取り上げたGPT-5.6 SolやClaude Fable 5・Opus 5より低額です。一方、DeepSWEやTerminal-Benchでは競合が上回り、Gemini 2.5 Proには約100万トークンの入力枠と動画・音声への対応があります。出典:xAI発表/Googleモデル仕様

選ぶ際は、同じ資料や同じ開発タスクを複数モデルに渡し、完成品質・作業時間・再試行回数・実際の請求額を記録するのが確実です。Grok 4.6を知識作業の第一候補にしつつ、複雑なコード修正にはGPT-5.6 SolやClaude、動画・音声を含む長い資料にはGemini 2.5 Proを比較対象にする――それが、公開データを過大解釈しない現実的な使い分けです。

コメント

タイトルとURLをコピーしました