2026年9月10日(木)掲載 4,231本日 26
HN15965

ついに次世代へ?Qwen 3.8がGPT-5.5 Proクラスの推論プリフィル能力を獲得

Qwen 3.8 follows GPT-5.5 Pro reasoning prefills

wsxiaoys約17時間前

議論

11
17734128約16時間前

これの何が問題かって、結局のところ我々が手に入れられる「GPT 5.5の思考」なるものが、盗まれた思考(stolen thought)からしか得られないってことだよね。

Qwen 3.8 0902は8月10日の論文公開後に学習されたものだから、それらの思考を実際に見ていたはずだよ。

2wongarsu約16時間前

その書き方はちょっと硬すぎるかもね。

理解が正しければだけど(https://stolen-thoughts.com/paper.pdf の付録Bを参照するのが重要)、彼らはOpenAIやAnthropicのモデルから読み取り可能なCoT(Chain of Thought)を復元する有名なエクスプロイト手法の作成者だよ。彼らはその手法を使って蒸留の痕跡を探しているんだ。SotAモデルを使ってベンチマークを走らせ、CoTを復元し、その最初の1%を取り出して、あたかもオープンソースモデル自身のCoTの始まりであるかのように入力する。論文によると、Kimi-K3にClaude 4.8の推論の冒頭をプレフィル(先読み)させると、Claude 4.8の回答にかなり近づくことがわかった。これはClaude 4.8がポストトレーニングに使われたことを示唆しているね。今回のブログ記事はその続編で、Qwen3.8もGPT-5.5 Pro(あるいはそれと似た反応をするGPTモデル、何個テストしたのかは不明だけど)を使ってポストトレーニングされた可能性が高いという結果を示しているよ。

3jari_mustonen約16時間前

Qwenは以前の実験ではOpus 4.8に対してほとんど変化が見られなかったが、今回はGPT-5.5 Proに対して+20.58ポイントも向上しており、非公開の合成パズルにも大きな影響が見られた。データは、QwenがOpusからではなく、GPT-5.5 Proやそれと密接に関連するGPTモデルから学習した可能性を示唆している。

これのどこがそう示唆しているっていうの?

4CamperBob2約16時間前

ニュース速報:許可なくインターネットをスクレイピングして製品を作ってきた連中が、自分たちも似たようなことをされると文句を言ってるよ。水は濡れているし、空は青い。詳細は11時のニュースで。

(slibhbさん:誤解しないでほしいんだけど、言ってることには99%同意だよ。ただ、フロンティアラボ側にはこの件に関して道徳的な正当性が一切ないっていう話さ。)

5brcmthrowaway約15時間前

これには正直がっかりしたな。

もしQwenや他の中国のラボが推論トレースをただコピーしているだけだとしたら、それらのラボはフロンティア(最先端)から1年以上遅れていることになる。

6spijdar約15時間前

他の誰かもこれに気づいていたのは興味深いね。1〜2週間前、GPT-5.6 SolがPiへのツールコールに推論内容を漏らし始めたんだ。何が起きたのかはよくわからないけど、……面白かったよ。

  Attach. Use hub debugger. Ensure source binary perhaps same. start. todo init. parallel no. two tool calls in same turn sequential is okay. immediately. exactly. Need not mention apologies yet final. [...] Let's do. [...] Do tools. Use commentary. Let's initiate. rambling no. use tool. searching now. okay. Really must call. Let's send. done. why stuck? generate. Sorry. go. no more. (The answer engine expects tool). [...] I think no hidden issue. Go. I'll type tool. now. Stop internal repetition. We have 8000 tokens. tool. sorry. I'll produce call. need include i. Great. final. no. Let's send.gpt. This may be bug. I'll consciously construct tool message next.

最終的に何らかのエラーステートを引き起こして停止したんだけどね。

とにかく、SolのCoTを見たのはこれが初めてだった。例の「stolen thought」の論文を調べてみたら、ああ、やっぱりあれはSolのCoTそのものだったよ。

でもふと思ったんだけど、Qwen3.8 27BのCoTも……すごく似てる気がする。

論文内の幾何学問題を比較してみたんだ。あちらの推論ブロックの始まりはこうだった:

  We need solve. Need reason geometry Weber point? Given pentagon sides and angles. Need find min sum distances. Likely construct rotations / Fermat point lower bound via vectors calibration, maybe triangulation.

同じプロンプトをQwenに投げたら、こんな風に始まった:

  We need solve geometry optimization. We need provide final answer. Let's analyze thoroughly.

これだけじゃ何も証明できないけど、彼らがGPT-5.5/6の推論トレースを使った可能性はかなり高いように思える……。

7c7b約15時間前

生の推論トークンにアクセスできるなんて知らなかったんだけど?てっきり要約みたいなものしか得られないんだと思ってたよ。著者は何か特権的なアクセス権を持っているのか、それとも僕の前提が間違っていたのかな?

まあ今回調査されている問いに関しては、それが何であれ、公開されている出力の重なりが蒸留(またはそれ以外の何か)の兆候である可能性があることに変わりはないだろうね。ただ、中国のラボがそんなに疑いもせずにそれを使っているのだとしたら驚きだ。公開された推論トレースなんて、真っ先に蒸留によるポイズニング(汚染)を仕込まれる場所だろうし。

8hermitShell約14時間前

ローカルモデルのユーザーとしては、ローカルモデルのパフォーマンスを向上させる「魔法の呪文」があるってこと?

何らかの手法で情報を復元する詳細については見たけど、興味深い反面、汎用的なものではなさそうだな。

特定の問いに対してなら有効かもしれないけど、特定のタスクでオープンモデルの性能を底上げするような、優れた埋め込みを追加する技術とは別物みたいだ。

9syntaxing約14時間前

3.8がこれほど向上した理由はそれなのかな?両側の推論トレースを混ぜ合わせるのが効果的なのかも。

10nzeid約11時間前

QwenとGPTの重複が、不正な学習や事後学習によるものだというコメントを見かけるけど、両方のモデルセットが、研究者のベンチマークにある同じ回答に対して直接学習された可能性を考えた人はいないのかな?