なぜ、信頼できるのか
信頼性は、アーキテクチャに組み込まれている。
要点
今日のモデルは、優秀だが頼りにならないインターンだ。DeTarsはそれを、6つの構造的な性質によって信頼できるものにする——約束ではなく、あなたが検証できるメカニズムだ。
6つ
- 自分で考える。ゴールを与えれば、仕事を分解し、専門家のチームを組み、進捗を追い、結果を待つために止まり、そして再開する。やり方はその場で考え抜く。焼き付けたスクリプトではない。
- 倒れない。レート制限、タイムアウト、スリープ、クラッシュ——それぞれを迂回すべき事実として扱う:退いて、再試行し、チェックポイントを取り、再開する。一晩走らせて、朝に結果を読めばいい。
- ごまかせない。‘完了’は必ず履行すべきレシートだ:納品され、証拠に裏打ちされ、独立レビューを経る。すべての引用はコンテンツハッシュで封印され——一文字でも変えれば即座に無効になる。
- 免疫系を持つ。自分の過ちを狩り、それぞれを永久的な回帰カバレッジに変える。自分自身の自己点検ツールのバグを、これまでに二度捕まえている。
- あなたのもの。それはあなたのマシンの中で生きる。覚えることはあなたの了承を要し、あなたのディスク上のファイルとして在る。RewindやHumaneがユーザーを文鎮化させたようなことは、誰にもできない。
- 囲い込まれない。それぞれのジョブを、最も合う頭脳へ振り分ける——米中の最前線モデルか、あなたのノートPC上のローカルモデルか、切り替えられるのは約50。エンジンは自前であって、誰かのAPIのラッパーではない。
そして自分で進化する
信頼性は一度調整して終わりではない——複利で積み上がる。3つのフライホイールが、どのバージョンも打ち破りにくくする。
- 自己堅牢化。自分の過ちを狩り、それぞれを永久的な回帰カバレッジに変える——だからどのバージョンも前より壊れにくい。買えない信頼性、積み上げるしかない信頼性だ。
- 自己最適化する記憶。自分の記憶システムを絶えず再編成し、刈り込むので、成長しても想起が鋭いまま保たれる——一方で、あなたについて覚えることは、なおあなたの了承を要する。
- 自己拡張。タスクに足りない能力が必要になれば、自分のツールやスキルを自分で生成し、インストールし、管理する——リリースを待たずに、自律的に新たな能力を育てる。
その下で:支えるエンジニアリング
細部を知る必要はない——だが、どれも検証できる。実装そのものは公開しないコアIPだとしても。
- データベース級の書き込み規律。だからエージェントのチームが互いの仕事を上書きすることはない。
- コンテンツ指紋による証拠:未読の、あるいは改変された出典は引用できない。
- キャッシュを意識したルーティングがモデルのKV / prompt cacheを熱く保つ——繰り返す文脈に二重請求はなく、長いタスクははるかに少ないtokenで済み、モデルが値下がりすれば請求も下がる。
- 百万語規模の素材を、モデルが一語読む前にインデックスへ事前消化。
- 保全された予算台帳。だから自分に無限のスコープや支出を与えることはできない。
- 走行中のランを横で見直し、修正をフィードバックする読み取り専用の第二の頭脳。
- 型付けされた障害復旧——レート制限、タイムアウト、ブロックは、それぞれ別のレーンを通る。
- 不可逆な操作(発注、送信、機密の認証情報)は、あなたが許可するまで既定でロック。