2026年8月15日(土)掲載 3,548本日 0
HN533234

【DeepSeek】LLM評価の新定番?「DeepSeek Harness」デベロッパープレビュー公開

DeepSeek Harness developer preview

bjin1日前

議論

11
0bjinスレ主5331日前

DeepSeekモデルの評価を強力にサポートするツールキット「DeepSeek Harness」のデベロッパープレビューが公開されました。GitHubリポジトリ(https://github.com/deepseek-ai/deepseek-harness )および、詳細な使い方が確認できる公式ガイド(https://deepseek-harness.github.io/deepseek-harness/en/guide/quickstart )が現在利用可能です。AI開発の効率化に興味がある方はぜひチェックしてみてください。

1syntaxing1日前

こうしたエージェントのハーネスがNode.jsで書かれていることが多い理由って何かあるの?

2rco87861日前

で、結局これは何なの?Hacker Newsで1位になったのが不思議なんだけど。READMEもインストール手順と「Cordis(時空間的構成可能性のためのメタフレームワーク)」へのリンク以外はスカスカだし。「現在活発に開発中。APIはまだ安定しておらず、予告なく変更される可能性がある」って書いてあるしね。

3lxdlam1日前

元の論文を読んだけど、便利かもしれないけど、そこまででもないかな。

何ができるのか知りたい人へ:Piエージェントにあるようなプラグインシステムに、ホットリロードや動的な有効化/破棄機能を追加するものだよ。UIコンポーネントまで踏み込んでるから、そこは一歩先を行ってる感じ。

何をしているのか知りたい人へ:PLT(プログラミング言語理論)の知識があれば、エージェントに代数を解説させるといい。馴染みがない人のために説明すると、このフレームワークは各プラグインに初期化と破棄の定義を必須にしている(C++のRAIIやRustのDropトレイトみたいなもの)。ランタイムがライフサイクルイベントやよくある落とし穴を適切に処理してくれるんだ。さらに、プラグイン間の依存関係を宣言するクリーンな方法も提供していて、より広い範囲でライフサイクルの変更を適切に処理してくれる。

OSGi、iPOJO、ReactのuseEffect(論文でも言及されてる)なんかに詳しくないなら読む価値はあると思うけど、詳しい人なら斜め読みで十分。よくある問題の注意点は指摘しているけど、代数的な部分が役に立つかは微妙。

4invaliduser1日前

「すべてをプラグインにするアーキテクチャ」か……。もうそれだけでお腹いっぱいかな。長年やってると「プラグイン疲れ」っていうのがあってさ。

「コミュニティプラグイン」に依存する製品って、最初は半年くらいはうまく動くけど、その先は互換性のないプラグインや非推奨のプラグインが乱立する悪夢になる。一貫性もガバナンスもなし。

小さな製品を作って、機能追加は他力本願で……っていうのが企業にとって魅力的で、うまくいくことを願う気持ちはわかるけど、個人的には関わりたくないね。

5tianyicui1日前

こんにちは、DeepSeek Harnessの作者の一人です。今はまだ開発初期のプレビュー版をMITライセンスで公開している段階です。荒削りな部分も多いし、互換性を壊す変更も発生すると思います。フィードバックや提案は大歓迎です!

6vhantz1日前

この分野のイノベーションに対する意欲の欠如は明らかだよ。どのラボも他人の真似ばかり。個人的に一番理解できないのは、かつては優れた開発者の本能だった「再利用可能で、テスト可能で、決定論的なコードを書く」という感覚が、言語モデルに何とかしてくれと懇願するMarkdownの海の中に消えていっていることだ。例えばこのリポジトリにある「スキル」定義なんて、LLMにプリコミットチェックを実行させるよう指示するだけ。でもそんなのずっと前に解決済みだよね、git hooksを使えばいいんだから。なぜその指示を、gitツール呼び出しそのものの中に、テスト可能で再利用可能な決定論的コードとして組み込まないのか理解できない。みんな脳みそを取り出して引き出しにしまっているみたいだ。

7Kuyawa1日前

これ気に入ったよ、美しいね。特に軌跡(trajectory)タブがすごく明示的で、何をしているのか詳細にわかるのがいい。プラグインアーキテクチャもいいけど、プラグインがアルファベット順に並んでいてくれたら、順不同のテキストの海から探すのに何時間も無駄にしなくて済むんだけどな。

10点中9点。

追記:アプリを作成してみたら期待通りに動いた。文句なし、祝うべきことがたくさんあるね。0.1バージョンだからさらなる驚きがあるかもしれないけど、現時点では、最高に手頃で強力なAIを使ってエージェントコーディングを始める人にとって完璧なツールだよ。本当に素晴らしい。

8SwellJoe1日前

「すべての実行は追跡可能。モデルが見るすべてのものは、追記専用のセッションログに記録される:システムプロンプト、推論、ツール呼び出しと結果、サブエージェントのスケジューリング、コンテキスト注入など。軌跡ビューでは、これらの記録をソースごとに確認できる。再開、フォーク、検索、リプレイのすべてが同じイベントストリーム上で動作する。」

これこそがキラー機能だと思う。米国のモデルでは、トレースが暗号化・難読化されていて、(利用規約違反になる)回避策を使わないと抽出できないから、こういうことはさせてもらえないんだよね。

モデルと連携するツールを改善したいなら、モデルが何が起きていると認識し、与えられたデータについてどう考え、どう対話しているのかを評価できなきゃいけない。米国のモデルは、その中身を見せてくれないんだ。

9ef2k1日前

重要なことを見落としがちだけど、このハーネスは今日公開されたCordis v4の論文を使っているんだ。Cordis自体は、v3を使って『Koishi』という別のプロジェクトですでに4年間使われてきた。Cordisの正体は、実行中のプロセスを再起動せずにプラグインをホットロード/アンロードする仕組み。すごいのは、アンロードする時に、作成した状態や副作用をすべて元に戻して、接続、メモリ割り当て、登録されたハンドラなどをクリーンアップできること。他のプラグインを邪魔することなく、依存していたプラグインを非アクティブ化することもできる。

10z_rho_one約19時間前

今日読んだ内容からすると、DeepSeek Harnessは設計的にPi Coding Agentと似ているみたいだね。どちらも最初は必要最低限で、プラグインに大きく依存している。でも、DSHが際立っている点が3つある。

  1. DSHのプラグインにはクリーンアップハンドラが必須だから、セッションの途中で不要になったプラグインをクリーンアップして、現在のタスクへの干渉を防げるのかも?(ここは確信がないけど)
  2. DeepSeek V4モデルはDSHで事前学習されている。OpenAIやAnthropicのモデルと比べてDS V4がどれだけ安いかを考えると、DSHでDS V4を動かすのはパフォーマンスをほとんど落とさずにコスト効率を大幅に上げられる可能性がある。
  3. オープンソースAIに注力する大規模なラボによって活用・メンテナンスされている点。小さなチームが重い荷物を背負って苦労するのに頼らなくて済むよう、大規模ラボから新しいオープンソースツールが出てくるのはいつも嬉しいことだよ。