【脱・沼】AIによるWord文書編集を爆速化!SOTAな「Vespper」がすごい理由
Launch HN: Vespper (YC F24) – SOTA Docx MCP
Launch HN: Vespper (YC F24) – SOTA Docx MCP
皆さんこんにちは!Vespper (https://vespper.com) のDuduとTopazです。Vespperは、AIエージェントがWord文書(.docx)を爆速かつ効率的に編集できるようにするMCP(Model Context Protocol)です。独自のファインチューニング済みモデルを活用することで、既存の代替手段と比較して3倍高速、2倍低コスト、そして高い精度を実現しました。動作イメージはこちらで確認できます:https://youtu.be/odKxsgPjzzw
私たちは元々、製薬会社向けのAI文書エディターを開発する中でこの課題に直面しました。私(Topaz)はSnykで分散システムを担当し、DuduはViz.aiで脳卒中検知のためのコンピュータビジョンモデルを構築していました。当初はMarkdownを出力してWYSIWYGエディターで表示していましたが、ユーザーは既存のWordテンプレートでの作業を熱望しており、そこから悪夢が始まりました。
AIにとってWordファイルの編集は難易度が高すぎます。Wordの実体はOOXMLという冗長なXMLファイルの集合体であり、単なる箇条書きの追加でさえ複雑なXML操作が要求されます。そのため、単純なunzipやgrep、sedでの編集はAIにとって効率が悪く、トークンと時間を浪費する原因となります。現在のツール(python-docx、MCPツール群、変換ライブラリ等)はどれも設定が複雑だったり、情報欠落が激しかったりと、実務には耐え難い状況でした。
そこで私たちは、AIがWordを「HTML」のように編集できるMCPを設計しました。AIはHTMLを受け取り、find-and-replace(検索・置換)を行うだけで、私たちがそれを元の.docxへ正確に反映させます。HTMLならCSSによるスタイリングの概念がOOXMLに近く、AIも扱いやすいからです。独自のDOCX→HTML変換エンジンにより、AIには必要な構造情報を保持したまま編集させ、元のWordファイルは「真実のソース」として直接書き換えます。
このアプローチにより、AIは複雑なDSLを学ぶ必要がなく、わずか3つのツール(read, search, edit)だけで動作します。編集の差分はファインチューニング済みのLoRAアダプター搭載モデル(3-8B)がOOXMLへ変換するため、非常に軽量かつ高速です。
v1をリリースし、社内ベンチマークでは従来のDOCXライブラリよりも圧倒的に少ないツール呼び出し回数(p50で3回)で高い精度を達成しました。現在は画像やコメント操作は未対応ですが、法務テック、履歴書作成支援、GovTech、ライフサイエンス分野などで活用が進んでいます。
プライバシーに関しては、ユーザーデータでの学習は行っておらず、ZDR(ゼロデータ保持)オプションやセルフホストも可能です。月間500編集までは無料ですので、ぜひ試してみてください。皆さんのご意見やフィードバックを心待ちにしています!
ちなみに、Vespper MCPを使ってWordアドインを構築する方法を示すWordアドインのプロジェクトをオープンソース化したよ。 https://github.com/vespperhq/examples/tree/main/word-add-in
無料で登録して試してみて: https://app.vespper.com/
うちは顧客から渡されるテンプレートを埋める必要があるんだけど、既にpython-docxを使ってエージェントハーネスを構築済みなんだ。完璧じゃないけど一応動いてる。Vespperはそれを完全に置き換えるものなの?それとも自分たちのハーネスとMCPを併用できるのかな?
確かにこれは必要なものだし良いと思うけど、ベンダー製のものを含めて半機能的なWord用MCPサーバーは他にも4〜5個あるよね。このプロジェクトもまだ機能が完結してないみたいだし。失礼に聞こえたら悪いんだけど、正直どうやってこれでYCに採択されたの?元々のビジネスプランやアイデアから何かピボットしたのかな?
自分は https://github.com/eigenpal/docx-editor のエージェントを使ってツールを構築したよ。既存のAIが使えるし外部サービスに接続する必要もないし、何よりオープンソースだしね。自分があなたのソリューションを使うメリットって何だろう?