Condense.chat 是什麼?壓縮代理如何幫 coding agent 省 token 帳單
7 月 3 日,Condense.

7 月 3 日,Condense.chat 開放了一個插在 coding AI agent 與底層模型之間的壓縮代理(compression proxy),不改系統提示即可接入,設計目標是直接削減 token 帳單。兩個自研模型各自負責不同的壓縮時機:Helene 1 在 token 進入快取(cache)前率先介入,剔除這個節點前已積累的冗餘;Adeline 1 則在 agent loop 收斂定型後才上場,把已固化的迭代歷程壓縮到約原體積的 9%,也就是超過九成的 loop 內容被精簡掉,只剩核心骨架繼續傳遞給模型。
這兩個壓縮節點在時序上不重疊,Helene 1 搶在快取前截流,Adeline 1 清理定型後的冗長記錄,兩者理論上能疊加降費。Condense 不要求修改系統提示的設計也有工程意義:工具呼叫(tool call)的輸出因此不被碰觸,對現有 agent pipeline 的侵入性理論上最低,工程師不需要重新調整 prompt 工程就能接入。就定位而言,這更接近基礎設施層,而非需要深度整合才能上線的應用層工具。
這個切入點回應的是 agentic loop 成本不可持續的討論。coding agent 跑幾輪迭代後,context window 很快被歷史對話與工具呼叫記錄撐滿,token 消耗往往加速而非線性成長,帳單幾次 session 後就讓工程師不得不開始重設 context 或主動壓縮用量。Condense 把降費包成獨立的中間層,不改模型、不動 prompt,只在 token 進入模型前截流,是目前看來把這條主線做成可插拔基礎設施的一種路徑。需要誠實標注的是:Adeline 1 的 9% 壓縮比與「工具結果不受影響」均屬廠商自述,整則資訊來源為單則推文,目前沒有第三方 benchmark 可以交叉驗證;對考慮選型的工程師而言,這兩個關鍵假設需要在自己的真實 workload 上測試過才算數。
標籤


