ハーネス自体をOSS化
TrueFoundryが自社本番で使っていたエージェント・ランタイムをMITで公開した。
TrueForge
TrueFoundry が自社本番で使っていたエージェント・ハーネスを MITライセンスで公開した。モデル非依存・自前インフラ運用可能で、Claude Managed Agentsと品質をほぼ同等に保ちながら、同じモデルで約30%、オープンモデル併用で最大75%のコスト削減を主張する。ベンダーロックインからの解放だ。
発表
TrueFoundryが自社本番で使っていたエージェント・ランタイムをMITで公開した。
DevRev Enterprise-Bench 14タスクでClaude Managed Agentsとほぼ同じ解決数。
同じモデルで約30%、GLM-5.2併用で約75%安いと主張。
エージェントループはサーバー側。サンドボックスは必要時だけ起動。
任意モデル、任意MCP、自前インフラ。ベンダーロックインなし。
モデルは簡単に差し替えられる時代。だからハーネスこそ自前で持て、という思想。
機能
TrueForgeが提供するのは「エージェントの外側全部」だ。
Localモードは npx 一発(SQLite)。Hostedモードは Docker / Helm(Postgres + Redis)で複数レプリカ対応。
差別化
Sandbox as a Toolが最大の設計上の違いだ。多くのハーネスは「エージェント全体をVMの中で動かす」。TrueForgeはループをサーバー側に置き、サンドボックスを「コード・ファイル・シェルが必要なときだけ」ツールとして起動する。
Context Engineeringがトークン消費を抑える核心だ。
数字
DevRev Enterprise-Bench(CRM + 課題管理 + ドキュメント管理を横断する14タスク)で、同一ツール・fresh session・ブラインドLLMジャッジで比較した。
| 構成 | 解決数 | コスト / run | トークン / run | 備考 |
|---|---|---|---|---|
| Claude Managed Agents Opus 4.8 |
~10.7–11 / 14 | $11.8 | ~10M | ベースライン |
| TrueForge Opus 4.8 |
~10.7–11 / 14 | $8.5–8.6 | ~3.7–3.8M | 同じモデルで約30%安い |
| TrueForge GLM-5.2 |
~11.7 / 14 | $2.9–3.0 | ~3.7–3.8M | 約75%安い |
| deepagents (LangGraph) Opus 4.8 |
~10 / 14 | $21 | ~16.5M | 比較対象 |
同じモデルでもトークンが大幅に減る理由は、leanな初期ペイロード、少ないツール呼び出し、CompactionとOffloadingにある。Claude Managed AgentsはClaude以外を選べないため、オープンモデルによる追加のレバーが効かない。
導入
最速起動(Local)
Node 22+ があれば http://localhost:8790 でChat UIが立ち上がる(SQLite)。
Hosted(チーム・本番):Docker Compose または Helm。Postgres + Redis。OIDCログイン、複数レプリカ対応。同じハーネスがLocalからHostedまで一貫して使える。
コスト感:ハーネス自体は完全無料。実際にかかるのはモデルAPI費用 + サンドボックス費用のみ。
意味
モデルの性能差が相対的に縮小する中で、エージェントのコストと制御可能性を決めるのは「外側のランタイム」になった。
すでにTrueFoundry内部のAskTFYや、NetApp・Automatiqなどで本番利用の実績があるとされる。高ボリューム運用ほど、ハーネス効率の差が請求書に直結する。
リスク:まだ公開直後のプロジェクト。ベンチは特定タスクセット。Localモードは実験用途。本番ではHostedモードと適切なガバナンス設計が必須。
誰にとってサプライズか:Claude Managed Agentsや類似マネージドハーネスを使い始めているチーム。エージェントを自前で本番運用したいが、ハーネス層の実装コストを避けたいエンジニア。モデル選択の自由度を失いたくない企業。
まとめ
TrueForgeは、Claude Managed AgentsのOSS代替として爆誕した。モデルは差し替えられる。ハーネスを所有できるかどうかが、次の差になる。
2026-08-19 — AI Intelligence Hub / Day Slide No.384
Sources: truefoundry blog · benchmark · GitHub · docs · VentureBeat