Grok 4.7が登場!最新アップデートの全貌まとめ
Grok 4.7
Grok 4.7
Grok 4.7がリリースされました。
Grok 4.7はGrok 4.6より重みが40%増えたらしいけど、価格(出力トークン$6、入力トークン$2)は据え置きだね。
利益率を削っていることや、本来の予定から2週間近くリリースが遅れたことを考えると、xAI側も4.7の結果には満足してなかったんだろう。それに、Opus 5.5の噂の発表日の前日にぶつけてきたのも気になる。ベンチマーク性能でOpus 5.5にボロ負けするんじゃないかな。
とはいえ、最近はベンチマーク自体に懐疑的になってる。Grok 4.5は、Fable 5ではできなかったBuildrootシステムのセットアップに関する問題をいくつか解決してくれたしね。Cursorで使った後のGrokはフロントエンド開発では凄まじい性能を発揮するけど、バックエンドのRubyだとClaudeの方がずっと上だ。
新しいGrokで一番気に入ってるのは、平易な英語で話してくれるところ。Claude特有の言い回し(Claudish)は正直耐えられない。GPTもClaudeのような変なクセはないけど、技術的な概念の説明を適当にごまかす傾向があるし。結局、説明に関してはClaude 3.5や4に勝るものはないね。どのモデルも退化している気がするし、Grok 4.7もRL(強化学習)のせいで英語の質が落ちてないといいんだけど。
リリースのペースが上がって品質も改善し続けているのはいいね。これらのモデルは、Cursorチームが現在所有している膨大な計算リソースを統合して得られた成果がベースになっているんだろう。チームがより大規模な学習環境に慣れて自信をつけていけば、今年後半のGrok 5では大幅な飛躍が見られるはず。競争力のあるフロンティアモデルがまた一つ増えることに期待!
Astraの足元にも及ばないよ。Astraは別次元。高価だけど、タスクをこなすためのトークン消費がはるかに少ないからね。
xAIはチャンスを逃したよ。今はAnthropicの独壇場だね。
https://tools.simonwillison.net/markdown-svg-renderer?url=ht... (https://tools.simonwillison.net/markdown-svg-renderer?url=https%3A%2F%2Fgist.github.com%2Fsimonw%2F58dc4e8ec482330856fce89dac670727) - これがデフォルトの推論レベル。
こっちは推論レベル「High」:https://tools.simonwillison.net/markdown-svg-renderer?url=ht... (https://tools.simonwillison.net/markdown-svg-renderer?url=https%3A%2F%2Fgist.github.com%2Fsimonw%2F8ab126bda2b384264b3ad931e3ebb8b4)
なぜか推論努力値「Low」と「Medium」で消費トークン数が似通っていて、「xHigh」の方が「High」より少ない結果になった。OpenRouterを挟まずに試す必要があるかも。
追記:xAIのAPIを直接使って再検証してみた:https://tools.simonwillison.net/markdown-svg-renderer?url=ht... (https://tools.simonwillison.net/markdown-svg-renderer?url=https%3A%2F%2Fgist.github.com%2Fsimonw%2F5a1819a2bd24bb642f38c4bc6733090f) - 推論レベルによる違いはあまり大きくないし、今回はなぜかxHighとLowで推論トークン数が同じになった。
比較用にGrok 4.6での実行結果も置いておくよ:https://tools.simonwillison.net/markdown-svg-renderer?url=ht... (https://tools.simonwillison.net/markdown-svg-renderer?url=https%3A%2F%2Fgist.github.com%2Fsimonw%2Ffedc404b9aa8e6fca31d59c898dabba0)
4.6を単発のゲームMODやユーティリティ作成に使ってみたけど、かなり良い感じだったよ。「超ニッチなキーボード(Moonlander)を持っていて、かなりニッチな宇宙シムをプレイしてるんだけど、そのキーボード用のSVGチートシートを作って」と頼んだんだ。キーボードのkeymap.cとゲームのinputmap.xmlを読み込ませるよう指示されて、しばらく考え込んだ後にかなり質の高い初稿を吐き出してくれた。それを生成するためのPythonスクリプトもセットでね。そこから1時間ほどやり取りしてスクリプトを洗練させたおかげで、キーボードのファームウェアやゲームのキー設定が変わっても柔軟に追従してくれる素晴らしい図が作れるようになったよ:https://files.catbox.moe/x0u76x.svg (https://files.catbox.moe/x0u76x.svg)
4.7も試すのが楽しみ。4.6で見られた「それはXじゃない、Yだ」みたいな変な訂正癖が直ってるといいんだけど。
Image-to-HTMLのワークフローは確実に改善してるね。Astra(現状この分野のSOTA)とGrok 4.7の比較テスト結果がこれ。
デザイン:https://image.non.io/78795662-8bfc-4e14-8d72-3738392aa6b3.we... (https://image.non.io/78795662-8bfc-4e14-8d72-3738392aa6b3.webp)
Astraのビルド:https://html.non.io/annui/ (https://html.non.io/annui/)
Grokのビルド:https://html.non.io/Annui-grok/ (https://html.non.io/Annui-grok/)
追加のプロンプト指示:「像の背後にスクロールする雲を追加。マウス位置に応じて像を動的にライトアップ。diffuiを使ってオブジェクトの法線マップ/深度マップ/ラフネスマップを生成し、アセットを異なるレイヤーに分割すること。」
全体として、モデルが画像を指示のソースとして理解する力はついてきているけど、出力の洗練度にはモデル間でかなりの差が出るね。Astraの最終出力の方が洗練されていて、視覚的なコントラストも良く、ページ間のアニメーションもスムーズ。Grokは背景要素までライトアップしてしまっていて、個人的には少しやりすぎ(Overcook)感がある。
とはいえ、価格を考えれば素晴らしい出発点だと思う。
第一印象としては、Grok 4.6は自分が試したどのユースケースでも力不足だった。私には利用用途(コーディングやエージェント型のワークフロー)において一定の最低基準があって、SolやOpusはその「知能の境界線」を上回っている感じ。
4.7は間違いなく低速で高コストになってる。ベンチマークのスコアを無理やり引き上げるためにトークンを浪費させてるような印象だ。ただ、その境界線を超えているかどうかは今のところ微妙なところ。とにかく遅すぎて、今日ベンチマークを取っても全然進捗が芳しくないし。
全体として、もしこれが私の知能の基準ラインを超えてくるなら良いリリースなんだけど……まあ深読みすると、Grokチーム自身も今回は「失敗だった」と思っているような気がする。
Redactle LLMベンチマークでGrok 4.7を試してみた。パズルゲームを使ったおふざけ評価に近いけど、全知能力をテストするにはなかなか良い指標だよ。
Grok 4.7はボードの上位に食い込んでいる。Grok 4.6からは大きな改善だけど、Gemini 3.8 Flashにはまだ及ばないな。あちらは安くて速いしね。
https://redactle.net/llm-leaderboard (https://redactle.net/llm-leaderboard)
素人質問で悪いんだけど……フロンティアモデルにおいて、結局何が一番の差別化要因になっているのかよく分からない。
学習データの質? それとも学習プロセス? それともハーネス(評価環境)?
どれも重要なのは分かってるんだけど、各フロンティアラボが「真に」注力して少しずつ精度を稼いでいる部分はどこなんだろう?