最終更新2026年8月14日 06:30

テック64

Grok 4.6がベンチ首位再燃

SpaceXAIのGrok 4.6は公開翌々日も、GPQA首位やWebDev Arena浮上で再評価されている。半額級のコスパ本命論と、体感はフロンティア手前・長コンテキストで倍額、という慎重論が割れ、Sol常用+Grok併用が残っている。

拡散の起点2026-08-14 未明

GPQA首位とArena浮上

Grok 4.6 HighがGPQA Diamondで首位、WebDev ArenaでFableとSolを抜いたとする投稿が再拡散した。

期間: 公開翌々日のベンチ再燃と実機信頼度: (英語ベンチは厚い。日本語実機は短評と価格表が中心)
拮抗
ポジティブ40%35–45%
中立30%25–35%
ネガティブ30%25–35%

何が起きたか

  1. 2026-08-12

    Grok 4.6を同価格で公開

    SpaceXAIがCursor・Grok Build・APIで即日利用、初週枠2倍を告知した。

  2. 2026-08-13

    価格帯の整理とCursor試用

    日本語圏ではSol/Fable/Grok/Lunaの三層に分け、Cursor上の合格と長コンテキスト倍額警戒が並んだ。

  3. 拡散の起点2026-08-14 未明

    GPQA首位とArena浮上

    Grok 4.6 HighがGPQA Diamondで首位、WebDev ArenaでFableとSolを抜いたとする投稿が再拡散した。

議論の現在地

主流派の視点
カタログ半額でSol級に並び、ベンチも上がっているのでバランス帯の本命、が主流
その他の視点
  • 体感はまだフロンティア手前で、デプロイまでは任せられない
  • 200k超でリクエスト全体が2倍になり、半額は名目だけになる
  • Sol常用・Fableサブ・システムはLuna、という三層は崩していない
  • モデル差よりCursor等のハーネス側が差になる
目立つ論者
  • SpaceXAI公式
  • ベンチ/Arenaの英語投稿
  • Cursor上の日本語実況
  • 価格表で三層に分ける開発者

世論の分布

意見陣営別シェア(推定レンジ)

Xサンプル上の可視的な言論に占める割合 · 下限—上限

  • コスパ本命派35–45%
  • 未達・消費警戒派25–35%
  • 併用様子見派25–35%
推定下限推定上限

ポジ / 中立 / ネガ 集計

陣営をスタンス別に統合 · 価格とベンチ再燃の歓迎が最大。端数をここで吸収し合計100

40%
30%
30%
ポジティブ 35–45%(コスパ本命派)中立 25–35%(併用様子見派)ネガティブ 25–35%(未達・消費警戒派)
テーブルビュー(グラフと同じデータ)
陣営スタンスシェア中心的主張
コスパ本命派ポジティブ35–45%半額級で速度も実用域。ベンチでもFableやSolに並び始めた(@minorun365、@yug1224、@XFreeze)
未達・消費警戒派ネガティブ25–35%体感はフロンティア手前。長コンテキスト倍額で名目半額は崩れる(@ivy432hz、@Fumiya_Kume)
併用様子見派中立25–35%バランス帯としては使う。常用はSol、サブにFableを残す(@ynishi2015、@gosrum、@tukiyomiiori)

進行中の論争

論点1

Grok 4.6はフロンティアの本命か

A側 · 本命

GPQAやArenaでFable・Solを抜き、半額で速度も実用域だ

B側 · 未達

体感は一世代前のやらかし期で、デプロイまで任せられない

根拠: @XFreezeの首位投稿と、@ivy432hzの体感未達が同日に並ぶ

論点2

カタログ半額は現場の半額か

A側 · 半額

入力2ドル/出力6ドルはSolやFableより明確に安い

B側 · 名目

200k超でリクエスト全体が2倍になり、Cursor外では怖くて使えない

根拠: 公式価格宣言と@Fumiya_Kumeのドキュメント指摘

主なポスト

SpaceXAI@SpaceXAI·公開起点Introducing Grok 4.6. It delivers frontier intelligence and is a significant improvement over Grok 4.5 at the same price.同価格での4.5比改善をうたった一次。シリーズの起点
SpaceXAI@SpaceXAI·価格宣言Grok 4.6 is faster than comparable models and can handle much more challenging tasks than Grok 4.5. It's half the price of other frontier models at $2/M input and $6/M output tokens.入力2ドル/出力6ドルの半額級ポジションを公式が固定した投稿

編集部まとめ

  • GPQA首位は第三者チャートの引用で、評価条件の一次はこのサンプルでは薄い
  • Cursor上の体験とAPI単体の体験が区別されずに語られる
  • 日本語実機は短評が多く、長時間エージェントの再現は足りない
この読みが変わる条件: ArenaやGPQAで順位がすぐ入れ替わり、首位が一日で消えた場合 / 200k超の倍額課金がCursorにも適用されると公式が明記した場合 / 日本語長文やデプロイ代行でFableとの差が実測で固定された場合