2026年8月31日(月)掲載 3,963本日 18
HN840421

爆速・低コストの新星「GLM-4-Flash」がやってきた!賢いLLMの選択肢がまた一つ増えたぞ

GLM-5.3-Flash

Philpax5日前

議論

11
0Philpaxスレ主8405日前

現在、AI界隈で注目を集めている「GLM-4-Flash」について議論されています。このモデルは、高いパフォーマンスと低コスト・低遅延を両立させており、開発者の間でその実力が話題です。特に、既存のプロプライエタリなモデルと比較しても遜色ない推論能力を持っており、コスト効率を重視するプロジェクトでの活用が期待されています。詳細は以下のリンクからYCombinatorの議論を参照してください。URL: https://news.ycombinator.com/item?id=49450353

1sunbum5日前

全てのトラフィックが中国製のAIチップで処理されているなんて

Nvidiaの株主さん、ご愁傷様です。

2mmastrac5日前

Hugging Face上のウェイトはこちら: https://huggingface.co/zai-org/GLM-5.3-Flash (https://huggingface.co/zai-org/GLM-5.3-Flash)

Appleが新しいハードウェアを出すだろうし、おそらくそのうちspark 2が出ることも分かっていたけれど、思い切って手頃な価格でsparkを4枚手に入れたよ(QSFPケーブルはAmazonの半額以下だったのでAliExpressで買った)。今の自分のニーズには丁度良さそう。2ノードのDS4で実験していたけど、特定のタスクには_良い_感じでも、推論の限界に達すると完全に頭打ちになってしまうんだよね。

単純なタスクならDS4と2枚のsparkでオフロードできるけど、新しい作業を試そうとすると、ある程度の複雑さを超えた瞬間に自力では全く動かなくなってしまう。

Opus-4.8レベルのローカルモデルが理想だけど、正直まだそこには到達できていない。今まで試したモデルも良いものだけど、プロンプトの工夫や環境にかかわらず、難しい技術的課題を解決する力は足りていないかな。

3revolvingthrow5日前

パラメータ総数は320Bで、アクティブパラメータはわずか18B

"flash"モデルとしてはかなり重量級だね。q4の設定でも256GBの環境じゃ足りないし、経験上q4は最低限使えるレベルとはいえクオリティは一番低いから。ベンチマークの数字は素晴らしいし、GLMは中国の平均的な研究所より誠実な傾向があるから期待できるけど、家で動かすにはかなりの大盤振る舞いが必要になるね。

編集:リリースが多すぎて計算を間違えてた。q4なら十分収まるね。現実的には最低限192GBあれば良くて、RTX 6000 Proを2枚刺しすれば爆速だし、256GBのユニファイドメモリでも実用範囲内。256GBなら5bit量子化もいけるかも。

…まあ、それでもかなりの出費は覚悟しないとだね。

4mrngld5日前

中国の研究所は、劣ったモデルを良く見せるためにベンチマークを操作することに慣れすぎているから、今回みたいに本当に良いモデルが出ても、公式発表が控えめすぎてその良さが伝わっていない気がする。

https://deepswe.datacurve.ai/ (https://deepswe.datacurve.ai/)

これはかなり堅い。Luna xhighより賢くて安いし、Luna maxよりは賢くないけど価格は抑えられている。Deepseek v4 flashを圧倒しているし、さらに悪いことにv4 proと同等レベルの性能をわずかなコストで実現している。Sol mediumとほぼ同等で、コストはほんの一部だ。

彼らはもっとリアルで最新のデータをもとにアピールすべきだったよ。Opus 4.8(5.0が出ているのに)と比較するような古い戦術じゃなくて、今の性能そのもので十分すごいんだから。

おめでとう!

5matheusmoreira5日前

みんなZ.aiの利用規約は読んだよね?

入力・出力データだけでなく、自分の名前やプロフィール写真に対しても広範囲かつ永続的なライセンスが適用される。

Z.aiの「利益」や、あるいは国家の「国益」を損なう恐れがあるものに対する曖昧な禁止事項。

「不快」または「不適切」なコンテンツに対する、定義不明な禁止事項。

Z.aiについて議論すること自体への曖昧な禁止事項。このコメントを投稿することさえ違反になる可能性がある。

Z.aiの「独自の絶対的な見解」で利用規約に違反したとみなされたらアカウントを凍結されるし、もし割引の年間プランに支払っていたとしても、返金なんて期待しない方がいいよ。

6bertili5日前

スピードが速すぎてすごい!HackerNewsを見ていて本当に良かったと思える瞬間だね。

7月16日:「Kimi K3モーメント」発生。中国がOpusに追いついた!

その4週間後:GLM 5.3登場。性能はそのままに、パラメータ数とコストを3分の1に削減!

さらに12日後:GLM 5.3 Flashが登場。GLM 5.3に迫る性能を維持しつつ、パラメータ数を半分、価格を5分の1にカットして、しかも中国製チップで動かしてる!

7dzonga5日前

リリース前に、GLM-5.3-Flashをox-alphaとしてOpenCodeとOpenRouterで匿名テストし、ユーザーフィードバックを集めました。すぐに今週最も人気のあるモデルとなり、全てのトラフィックが中国製AIチップで処理されました。

まさに今、我々はオープンな「葬式」を目の当たりにしているようだ。たとえ正当化できないことが明らかであっても、AI経済のバリュエーションを高く維持し続けることがみんなの利益になってしまっているんだよね。

モデル開発コストにせよ、ハードウェアコストにせよ、推論の提供コストにせよ。

8preommr5日前

じゃあ、GooglerたちがOx Alphaについてやっていたあの含みのある投稿は何だったの…?

コミュニケーションには慎重になる必要があるのは分かるけど、みんながOx Alphaは彼らじゃないかと噂しているときに、シニアメンバーなら「うちは関与していない」くらいはっきり否定できただろうに。

9bel84日前

OpencodeのGo 10ドル/月プランを使っていて、今すぐPiでGLM-5.3-flashを使いたいなら、Piが正式サポートするまでmodels.jsonにこれを追加しておくといいよ:

    {
      "providers": {
        "opencode-go": {
          "models": [
            {
              "id": "glm-5.3-flash",
              "name": "GLM-5.3 Flash",
              "api": "openai-completions",
              "baseUrl": "https://opencode.ai/zen/go/v1",
              "reasoning": true,
              "input": ["text", "image"],
              "cost": {
                "input": 0.15,
                "output": 0.5,
                "cacheRead": 0.03,
                "cacheWrite": 0
              },
              "compat": {
                "supportsStore": false,
                "supportsDeveloperRole": false,
                "maxTokensField": "max_tokens"
              },
              "contextWindow": 1000000,
              "maxTokens": 131072,
              "thinkingLevelMap": {
                "off": null,
                "minimal": null,
                "low": "low",
                "medium": null,
                "high": "high",
                "xhigh": null,
                "max": "max"
              }
            }
          ]
        }
      }
    }
10guybedo4日前

最初はローカルでこういうモデルを動かすのは経済的に合わないと思っていたけど、計算してみたら、ヘビーユーザーなら1万ドルのハードウェアを買っても数ヶ月から1年未満でROI(投資収益率)を回収できることが分かった。

普段使っているCodexやGrokのサブスク代と自分のトークン消費量を振り返ってみたんだが、自分はそこそこヘビーに使っている。週ごとの制限がなければ、実際にはもっとトークンを消費しているはずだ。

結局のところ、1万ドルの投資をしてこのモデルを動かせば、制限なしで今の2倍のトークンを使うと仮定してGLMのAPI価格と比較しても、1年以内に元が取れる計算になる。

もちろん今はサブスクにお金を払っているから計算は合わないけど、ローカルAIなら週ごとのクォータから解放される。計画作業用にはトップレベルのモデルのサブスクを維持して、実装やE2Eテスト、QA作業には24時間体制でローカルハードウェア+GLM-5.3 Flashを使うという手がある。

それほど突拍子もないアイデアじゃないし、数字も悪くないよ。