Microsoftの爆速コーディングAI「MAI-Code-1-Flash」が登場!爆速モデル7種を一挙解説
MAI-Code-1-Flash
MAI-Code-1-Flash
Microsoftから、高速かつ効率的なコーディング特化型AIモデル「MAI-Code-1-Flash」が発表されました。詳細およびモデルカード、そして新モデル7種に関する背景については、以下の公式リンクをご参照ください。・MAI-Code-1-Flash 公式ページ: https://microsoft.ai/models/mai-code-1-flash/ ・モデルカード(PDF): https://microsoft.ai/pdf/MAI-Code-1-Flash-Model-Card.PDF ・新モデル7種発表の背景: https://microsoft.ai/news/building-a-hillclimbing-machine-launching-seven-new-mai-models/
導入ブログ記事に詳しい情報がたくさん載ってるよ。
https://microsoft.ai/news/introducingmai-code-1-flash/
あとモデルカードもね。
https://microsoft.ai/pdf/MAI-Code-1-Flash-Model-Card.PDF
MAIモデルを7つ発表したっていう大きなアナウンスのほうが、タイトルにある5Bアクティブの出所みたいだね。
https://microsoft.ai/news/building-a-hillclimbing-machine-launching-seven-new-mai-models/
ベンチマーク結果は低いままなのに、モデルは「革命的」って宣伝されてるのがすごく不思議。コーディング能力が低くても問題ないなんて言うなら、トークン単価の値上げや「汎用モデル」構成の話と矛盾してない?
いっそ数学エージェントとして売ればいいのに。なんでわざわざ4つもエージェントを立てて相互チェックさせなきゃいけないのさ?
実際にこういった小さいモデルをコーディングに使ってる人っているの?もし使ってるならどうやって?普段は全部Opusで済ませてるんだけど。大きめのモデルで計画・設計・アーキテクチャをして、構造化されたタスクをこういう小さいモデルに委譲するやり方が正解なのかな?両方のやり方を試したことがある人の意見を聞いてみたい。
あれ、そのモデルカードによると総パラメータ数137Bのモデルだってさ。
パフォーマンスは微妙そう:
MAI-Code-1-Flash (137B-A5B) = SWE-bench proで51%
Qwen3.6-35B-A3B = SWE-bench proで49.5% (https://huggingface.co/Qwen/Qwen3.6-35B-A3B)
Claude Haikuと比較してるけど、Haikuってそもそも大したことないし、ローカルやAPIで動かせる10分の1のコストの軽量モデルより性能が低いよ。
Safariでのサイト表示もテストしてくれよ。iOSユーザーのほとんどがデフォルトで使ってるし、デスクトップ体験もモバイルと近いからテストは楽なはずだ。
あのスクロールエフェクト、俺の環境だとガクガクでひどいもんさ(ChromeやEdgeでうまく動くのは知ってるけどね)。
始まりの一歩だし競争は大歓迎だけど、Haiku 4.5みたいな小さなクラウドモデルを真面目に使ったことなんてないな。可愛いモデルだけど、本格的なコーディングで使うと貴重な時間を無駄にする傾向がある。
あと、昨日解約したGitHub Copilotに戻るつもりもまったくないね。
Copilotは昨日まで適正価格だったのに、リクエストベースからトークンベースのめちゃくちゃ高い課金体系に変えやがった。炎上してるサブredditを覗いてみると笑えるよ:https://www.reddit.com/r/GithubCopilot
今はDeekSeek FlashのHighに切り替えたけど、ほぼ無料でSonnet+レベルの性能が出てる。
もっと賢いモデルが必要だと思ったら、月20ドルのCodexに登録してGPT 5.5を使うかもしれない。今のところそれが手に入る最高のものだと思う。
サイトにマイクロソフトらしいデザイン言語が全然ないのはどういうこと?Anthropicのスタイルを真似ようとしてるのが見え見えで、安っぽく見えるんだけど。
ウィンドウのスクロールをわざわざ改悪して実装する人たちって何なの?
競争は大歓迎だけど、もっと効率的で低コスト、あるいは無料の選択肢が既にある中で、複雑なコーディングタスク向けにモデルを売り込むのは戦略として疑問だ。小さいモデルにも日常的で手間のかからないタスクという明確なニッチはあるよ。SOTAモデルに性能で劣ったとしても、彼らのほうが適している用途は山ほどあるんだから。
比較対象がHaiku 4.5なんだな。OpusでもSonnetでもなく、3世代も前のAnthropicの最小モデルっていうのがね。