最終更新2026年8月25日 14:10

Grok4.6の日本語は壊滅か実装向きか

月読いおり氏は、Grok 4.6は日本語の長文理解が壊滅的で、英語で書いてから翻訳した方が読めると書いた。日本語は壊れているという同意と、実装力は高いので用途を分ければ足りるという支持、英語以外は思考回路が英語のままだという整理が割れている。

拡散の起点2026-08-24 夜

日本語だと性能が下がると検証

月読いおり氏が、日本語資料から日本語長文は理解が難しく、英語で出して翻訳すると読めると書き、図の生成でも差が出るとした。

期間24日夜の検証から25日午前

信頼度(公式の言語品質説明は無い。個人の長文検証と短文の体感が混在)

ポジティブ32%
中立26%
ネガティブ42%

Grokの長文理解はいつ壊れたか

  1. そーくん

    Grok4.6の日本語が壊滅だって、また品質論争が戻ってきたんですか。

  2. ボス

    主戦場は一時の意味不明な連発ではなく、長文の日本語理解が壊れる品質論争だ。

  3. そーくん

    月読いおり氏の検証で、日本語だと性能が下がると出たのが起点なんですか。

  4. ボス

    図の生成でも差が出た、とある。日本語長文は英語で出して翻訳した方が読める。

  5. そーくん

    25日午前はCursor実装だと、日本語が変でも実装力はある、と分かれますか。

  6. ボス

    追認と使い分けが午前に並んだ。何が起きたかを、起点つきの時系列で見よう。

何が起きたか

  1. 2026-08 中旬

    意味不明な出力の報道が残る

    日本語では一時の意味不明な連発が品質論争として残っていた。この窓の主戦場は、暴走というより長文の日本語理解に移っている。

  2. 拡散の起点2026-08-24 夜

    日本語だと性能が下がると検証

    月読いおり氏が、日本語資料から日本語長文は理解が難しく、英語で出して翻訳すると読めると書き、図の生成でも差が出るとした。

  3. 2026-08-25 午前

    Cursor実装では評価が分かれる

    日本語は変でも実装力はある、推論レベルを選べると評価が変わる、Geminiへ切り替えた、という追認と使い分けが午前に並んだ。

壊れた大学生と実装力の分岐

  1. そーくん

    主流は、日本語で長文を回すと壊れた大学生に見える、という読みなんですか。

  2. ボス

    英語経由や実装用途では使える、が主流だ。つまり日本語直書きが前提ではない。

  3. そーくん

    思考回路は英語のままだ、という整理もあるんですか。表面は多言語なのに。

  4. ボス

    短文では差が見えにくい、という見方も並んでいる。長文検証との落差なんだ。

  5. そーくん

    Cursor側で推論レベルを選べると、実装の評価まで変わる、とあるんですか。

  6. ボス

    他モデルでも同じ落差かも、という一般化もある。主流とその他を先に見よう。

議論の現在地

主流派の視点
日本語で長文を回すと壊れた大学生のように見えるが、英語経由や実装用途では使える、が主流の見方
その他の視点
  • 表面は多言語でも、思考は英語のままだという整理
  • 短文では差が見えにくい
  • Cursor側で推論レベルを選べると実装評価が変わる
  • 他モデルでも同じ落差があるかもしれない、という一般化
目立つ論者
  • 長文検証の観測者
  • 実装用途で満足する開発者
  • 日本語の不自然さで他社へ移る人
  • 中国語など英語以外の同型観察

壊滅派の厚みはどれくらいか

  1. そーくん

    画面だと日本語は壊れている、が目立ちます。他の陣営の厚みも見えるんですか。

  2. ボス

    壊滅派が最も厚い。英語経由で使う層と、実装向きで容認する層がそれに続く。

  3. そーくん

    ネガが35%から50%って、中立やポジより上の幅が開いている、ということですか。

  4. ボス

    否定が厚い局面だ。割合は推定の幅なので、確定した数字だと思わないで見てほしい。

  5. そーくん

    じゃあ陣営ごとの推定の厚みと、ポジとネガの割合を先に見た方がいいですね。

  6. ボス

    そうだね。日本語壊滅、英語経由、実装向きの3つが、どう並ぶかを見てみよう。

世論の分布

意見陣営別シェア(推定レンジ)

Xサンプル上の可視的な言論に占める割合 · 下限—上限

  • 日本語壊滅派35–50%
  • 英語経由実用派20–32%
  • 実装向き容認派18–28%
推定下限推定上限

ポジティブ / 中立 / ネガティブ 集計

陣営をスタンス別に統合 · 中央値23を最大側で吸収し42+26+32=100

32%
26%
42%
ポジティブ 18–28%(実装向き容認派)中立 20–32%(英語経由実用派)ネガティブ 35–50%(日本語壊滅派)
テーブルビュー(グラフと同じデータ)
陣営スタンスシェア中心的主張
日本語壊滅派ネガティブ35–50%長文と複数ファイルでは日本語理解が壊れる。最近さらに不自然だ(@tukiyomiiori@maro_kt)
英語経由実用派中立20–32%英入力・英出力を翻訳した方が読める。日本語直書きをやめれば使える(@tukiyomiiori@kamepee_7)
実装向き容認派ポジティブ18–28%日本語文章は読みにくいが実装はよくやる。推論レベルを選べば評価が変わる(@kamepee_7@hoshimi12)

製品欠陥か用途の選び方か

  1. そーくん

    日本語の弱さは製品の欠陥なのか、用途を選べば足りる話なのか、どっちですか。

  2. ボス

    片側は長文で壊れた大学生だと言う。もう片側は、実装は強いので言語を選べと言う。

  3. そーくん

    英語で出して翻訳するのは、回避策として正当なんですか。本末転倒にも見えます。

  4. ボス

    正当側は図も英語経路の方がまともだと言う。反対側は日本語製品の前提が崩れたと返す。

  5. そーくん

    他社へ移る理由になる、という側もあるんですね。噛み合ってない点が本文に並ぶんですか。

  6. ボス

    では欠陥か用途かと、英語経由は正当かの2点を、A側とB側の言い分で見てみよう。

進行中の論争

論点1

日本語の弱さは製品欠陥か用途の話か

A側 · 欠陥

長文では壊れた大学生だ。バージョンを重ねても英語以外は改善が遅い

B側 · 用途

文章生成は弱いが実装は強い。推論レベルと入出力の言語を選べば足りる

根拠: 月読氏の検証と、かめぴー氏・星見氏の実装評価

論点2

英語経由は回避策として正当か

A側 · 正当

英出しを翻訳した方が読みやすい。図も英語経路の方がまともに出る

B側 · 本末転倒

日本語製品として使う前提が崩れている。他社へ移る理由になる

根拠: 英出し翻訳の成功報告と、Geminiへ切り替えた投稿

主なポスト

tukiyomiiori@tukiyomiiori·検証の起点「日本語で使うと、性能が下がる」 というのを、まさか、今頃になって突きつけられるとは思いもしなかった。 Grok 4.6 は日本語能力が壊滅的というのがはっきりとした。 日本語資料群→日本語長文章=理解が超絶難しい。🤔 英文資料群→日本語長文章=なにを言いたいのかよくわからない。🤔 英文資料群→英語長文章→(Luna翻訳)→日本語長文章=読みやすい!!!☺️ しかも、日本語文章でのMermaidやsvgの図(挿図)作成は、ゴミみたいの図しかでてこなかったのが、英文資料→英文文章では、すばらしいsvgが生成されてた。どういうこと? なんというか、性能の下がり方も「幼稚園児と大学生」とかいう話ではなくて「壊れた大学生と優れた大学生」みたいな感じ。 短文では、わかりにくいかもしれないが、複数ファイル&長文&長思考では、はっきりと見て取れる差ができる。 今回はGrok 4.6での検証だったけど、たぶんほかのモデルでも、同様の違いは生じているのではないだろうか?日本語直書きと英語経由の差を実験し、壊滅という語で当日の論点を開いた
kamepee_7@kamepee_7·実装と文章の分離Grok4.6はよく使っていますが、このモデルは日本語得意ではないですよね😅 実装とかとても良くやってくれて満足度高いですが、Grok4.6が出力する日本語文章は読みづらいです。 英in→英out→翻訳は気になりました✨️日本語は不得意だが実装は満足、と用途分けし、英語経由を追認した

編集部まとめ

長文検証だけでは日常は見えない

  1. そーくん

    ここまでの話を踏まえると、壊滅に見える根拠が長文検証の少数なのが気になります。

  2. ボス

    短文の日常利用はほとんど入っていない。つまり短いやり取りの失敗は測れていない。

  3. そーくん

    長文と複数ファイルで壊れる、という声が、全体の品質に見えてしまうんですか。

  4. ボス

    ごく少数の声が全体の空気に見えてしまう。長文で詰まった人だけが書きやすい。

  5. そーくん

    それ、まさに今回の長文検証ですね。失敗した人の投稿が、全体の壊滅に見えてしまう。

  6. ボス

    測れていない側がある。短文で困っていない人は、わざわざ検証投稿を書かない。

  7. そーくん

    最近さらに不自然だ、という声も、長文側の体験が厚い、と考えた方がいいですか。

  8. ボス

    その偏りを置いたうえで、公式が何を言っているか、言っていないかを分けよう。

公式の言語品質説明は出ていない

  1. そーくん

    xAI公式の言語品質説明は見つかっていない、とありました。つまり未確認なんですか。

  2. ボス

    公式の説明が無い。いまの壊滅という呼び方は、検証側の体験が先に走っている。

  3. そーくん

    じゃあ今回の壊滅というラベルは、公式の基準ではなく、検証者の体験なんですか。

  4. ボス

    そう読める。同じGrokでも、Cursor上と単体を同一視している投稿が混ざっている。

  5. そーくん

    なんでCursor実装と単体のGrok4.6が、同じ製品として語られるんですか。

  6. ボス

    名前が同じだと、画面の違いが消える。推論レベルの差まで、モデルの差に見える。

  7. そーくん

    じゃあ今回の実装は強い、も、推論レベルを上げた画面の話が混ざっているんですか。

  8. ボス

    評価が変わる、と午前に出たのはそこだ。同じモデルでも、思考の深さを選ぶと実装が変わる。

  9. そーくん

    思考の深さを選べるのって、外から見ると別の製品に見えるのが意外なんですけど。

  10. ボス

    同じ名前でも、思考を浅くすると短く雑に見え、深くすると実装は通るが日本語は重い。

  11. そーくん

    じゃあ今回の実装向きという評価は、思考を深くした側の話が混ざっているんですか。

  12. ボス

    混ざっている。実装が通った例が残り、日本語が壊れた例は別の側の材料になる。

3つの言い分が同時に立つ理由

  1. そーくん

    日本語壊滅派は、長文と複数ファイルでは理解が壊れる、と言っているんですね。

  2. ボス

    バージョンを重ねても英語以外は改善が遅い、とも見る。製品欠陥だ、という側だ。

  3. そーくん

    英語経由実用派は、日本語直書きをやめれば使える、と言うんですか。中立の位置ですね。

  4. ボス

    英入力・英出力を翻訳した方が読める、と置く。文章生成の弱さを、経路で避ける側だ。

  5. そーくん

    実装向き容認派は、日本語は読みにくいが実装はよくやる、と肯定するんですね。

  6. ボス

    推論レベルを選べば評価が変わる、とも言う。文章の上手さで製品を切らない側だ。

  7. そーくん

    なんでそうなるんですか。同じモデルなのに、欠陥と用途で全然噛み合わないですよね。

  8. ボス

    成功の定義が違う。書く仕事は読める文章が勝負で、実装の仕事は動くコードが勝負だ。

  9. そーくん

    じゃあ今回の割れ方は、文章の品質で切るか、コードが通るかで切るか、なんですか。

  10. ボス

    立場が違うと、同じ出力でも合格と欠陥が同時に立つ。用途を揃えないと議論が終わらない。

英語経由は回避か撤退か

  1. そーくん

    英語経由は回避策として正当、という側と、日本語製品の前提が崩れた側が残りますね。

  2. ボス

    正当側は図も英語経路の方がまともに出る、と置く。読む以前に、出す経路が勝負だ。

  3. そーくん

    本末転倒側は、翻訳前提なら他社へ移る理由になる、と言うんですか。製品の話ですね。

  4. ボス

    日本語で渡して日本語で返ってくる、が前提だと、英語経由は製品としては負けだ。

  5. そーくん

    思考は英語のままだ、という整理は、表面の多言語と中身が別だ、ということですか。

  6. ボス

    多言語対応でも、考える経路が英語だと、日本語長文は途中で形が崩れやすい。

  7. そーくん

    じゃあ今回の英出し翻訳が優勢、は、考える経路に日本語を乗せていない、ということですか。

  8. ボス

    実務ではそう回す人が厚い。ただし他モデルでも同じ落差、という一般化はこの材料では未検証だ。

追試と公式改善で読みは変わる

  1. そーくん

    この読みが変わるのは、公式が日本語長文の改善を出して、追試で差が消えた場合ですか。

  2. ボス

    差が消えれば欠陥の読みは弱まる。英語経由なしでも、日本語長文が普通に使える前提に戻る。

  3. そーくん

    逆に、実装用途でも失敗報告が積み上がったら、容認派の読みは崩れますよね。

  4. ボス

    実装でも壊れると、用途で分ければ足りる、が崩れる。欠陥側の話に一本化しやすい。

  5. そーくん

    英語経由なしで日本語長文が安定した、という追試が複数出た場合も、回避策は不要になりますか。

  6. ボス

    複数の追試で安定すれば、翻訳前提は一時しのぎだったことになる。日本語の直書きが戻る。

  7. そーくん

    結局、公式の改善と実装側の失敗と、英語なしの追試が、次の分岐なんですね。

  8. ボス

    君も長い依頼を日本語のまま投げて、英出しした方が早いと後から気づく側だろ。

  9. そーくん

    まいりましたー。日本語のまま長文を投げて、壊れた返事を製品のせいだけにするな、ですね。

FOLLOW & TALK

この話題を追う、話す