親手做了12個AI Agent,我並不看好2025年的智能體!

2025年07月22日18:43:15 科技 1257

親手做了12個AI Agent,我並不看好2025年的智能體! - 天天要聞

大模型爆紅後,不少人都在高喊「AI Agent 才是未來」,連英偉達 CEO 黃仁勛也曾斷言,Agent 將催生萬億級新市場。然而在一線開發者眼中,現實遠沒那麼樂觀。

近日,一位曾在開發、運維和數據運營等領域構建過 12 個以上生產級 AI Agent 系統的工程師發文,直言自己並不看好 2025 年這波 Agent 熱潮——他認為,當下關於「自主智能體」的設想在數學上根本走不通,真正能在生產環境中跑得穩的 Agent,也完全不是現在市面上宣傳的那一套。

原文鏈接:https://utkarshkanwat.com/writing/betting-agAInst-agents/

很多人說「2025 是 AI agent 元年」。各種新聞文章標題都這麼寫:

  • 「AI agent 會徹底改變工作方式」
  • 「Agent 是 AI 的下一個風口」
  • 「未來是屬於 Agent」

而我卻剛剛花了一年時間搞清楚哪些 Agent 在生產環境里真的能用,也正因如此,我才不看好這股風。


親手做了12個AI Agent,我並不看好2025年的智能體! - 天天要聞

我不是唱反調的人,我是真干過的

過去一年我做了十幾個上線的 Agent 系統,覆蓋整個軟體開發流程,比如:

  • 開發類 Agent:自然語言生成 React 組件、重構老代碼、自動維護 API 文檔、根據說明生成函數。
  • 數據和基礎設施類 Agent:自動執行複雜 SQL、搞定資料庫遷移、用 AI 管基礎設施代碼(IaC)並支持多雲。
  • 質量和流程類 Agent:AI 驅動的 CI/CD 流水線,自動修復 lint、生成測試、做代碼審查、寫 PR 描述。

這些系統確實能用,確實創造了實際價值,每天都能幫人省下好幾個小時的手動操作。也正因為如此,我才認為外界把 2025 稱作 「AI Agent 元年」 的說法,忽略了很多關鍵現實。


親手做了12個AI Agent,我並不看好2025年的智能體! - 天天要聞

要點速覽:關於 AI Agent 的三個殘酷現實

在構建了 12 套以上的生產級系統之後,我得出以下幾點結論:

  • 多步驟流程中的錯誤率會呈指數級放大。即便每一步的成功率有 95%,到第 20 步時整體成功率也只剩 36%。而生產環境的要求是 99.9% 起步。
  • 上下文窗口帶來的 token 成本是二次增長的。對話越長,成本越高,規模化後開銷驚人。
  • 最大的難題不是 AI 本身的能力,而是如何設計 Agent 真正能用的工具和反饋系統。


親手做了12個AI Agent,我並不看好2025年的智能體! - 天天要聞

一個沒人願意麵對的數學現實

所有做 AI Agent 的公司都在迴避一個難以接受的事實:在生產級別的多步驟任務中,錯誤的累積讓「全自動智能體」在數學上根本行不通。

親手做了12個AI Agent,我並不看好2025年的智能體! - 天天要聞

AI Agent 流程中的錯誤累積

咱們算算賬。如果一個 Agent 流程中每一步的可靠率是 95%(這對現在的大模型來說已經很樂觀了),那麼整體成功率就是:

  • 5 步流程,成功率約為 77%
  • 10 步流程,成功率約為 59%
  • 20 步流程,成功率僅剩 36%

而生產環境要求的可靠率通常要達到 99.9% 以上。即使你奇蹟般地讓每步成功率達到 99%(目前沒人做到),20 步的整體成功率也只有 82%。這不是提示詞設計的問題,也不是模型能力的問題,而是數學上的現實。

我做的 DevOps Agent 能用,正是因為它根本不是一個 20 步的全自動流程。它被拆分成 3-5 個獨立的、可以單獨驗證的操作,有明確的回滾點和人工確認環節。Agent 負責生成複雜的基礎設施代碼,但整個系統架構都是基於可靠性這個數學限制來設計的。

我做過的每一個成功 Sgent 系統都有相同的規律:有邊界清晰的上下文、可驗證的操作步驟,以及關鍵節點上的人工決策點。一旦你試圖讓智能體自主串聯起超過幾個步驟的複雜操作,數學就會讓你吃癟。


親手做了12個AI Agent,我並不看好2025年的智能體! - 天天要聞

長對話意味著成本爆炸

還有一個數學現實是很多 AI agent 支持者故意忽略的:上下文窗口會導致 token 成本呈二次方增長,這讓基於對話的 Agent 在經濟上根本不划算。

具體來說,做一個「會聊天」的 Agent 會遇到這樣的問題:

  • 每次新交互都得處理之前所有的上下文
  • token 消耗隨著對話長度成二次方增長
  • 一場 100 輪的對話,僅 token 成本就可能高達 50 到 100 美元
  • 用戶一多,成千上萬,這成本完全無法承受

我自己在做一個會話型資料庫 Agent 的原型時就深有體會。

剛開始幾次交互成本還低,但到了第 50 次請求時,每條回復花費已經是幾美元,遠超它能帶來的價值。絕大多數場景下,這種經濟模型根本行不通。

親手做了12個AI Agent,我並不看好2025年的智能體! - 天天要聞

我做的函數生成 Agent 之所以成功,是因為它完全無狀態:輸入描述-輸出函數-過程結束。沒有需要維護的上下文,也不用追蹤對話,避免了成本的爆炸。它不是「和代碼聊天」的體驗,而是專註解決具體問題的工具。

實際上,生產環境中最成功的 Agent 往往根本不依賴對話。他們是聰明而有邊界的工具,專註做好一件事,然後乾淨利落地退出,不拖泥帶水。


親手做了12個AI Agent,我並不看好2025年的智能體! - 天天要聞

最大難題不是模型能力,而是工具設計

你就算搞定了上面兩個數學問題,還得面對一個現實:AI 想用好工具,必須有合適的介面和反饋系統。但現在很多團隊都嚴重低估了這個挑戰

現在的工具調用其實已經相當精準了,真正的難點在於工具設計。每個工具都必須經過精心打磨,既能給出合適的反饋,又不能讓上下文窗口被信息淹沒。你需要考慮:

  • Agent 怎麼知道某個操作只是部分成功?怎麼在不浪費大量 token 的情況下傳達複雜的狀態變化?
  • 比如資料庫查詢可能返回 1 萬條數據,但 Agent 只需要知道「查詢成功,1 萬條結果,這裡是前 5 條」,設計這種抽象是一門藝術。
  • 當工具失敗時,Agent 需要哪些信息來恢復?信息太少它會卡住,太多又浪費上下文資源。
  • 怎麼處理相互影響的操作?比如資料庫事務、文件鎖、資源依賴關係。

我做的資料庫 Agent 能用,不是因為工具調用不出錯,而是因為我花了幾周時間設計了能和 AI 有效溝通的工具介面。每個工具都會返回結構化的反饋,Agent 能真正用來做決策,而不是單純拿到一堆原始的 API 響應。

那些號稱「接上 API,Agent 就能搞定一切」的公司根本沒做過這方面的工程工作。他們把工具當成人機交互界面設計,而不是針對 AI 設計。結果是,雖然 Agent 表面上能成功調用 API,卻無法真正完成複雜流程,因為它根本沒弄懂發生了什麼。

每個生產環境中的 Agent 系統背後有個不為人知的真相:AI 可能只做了 30% 的工作,其餘 70% 是工具工程——設計反饋介面、高效管理上下文、處理部分失敗,以及構建 AI 能理解和利用的恢復機制。


親手做了12個AI Agent,我並不看好2025年的智能體! - 天天要聞

整合現實考驗

假設你已經解決了可靠性和經濟性問題,接下來還得面對一個更大的挑戰——和現實世界系統的集成,而現實往往很複雜糟糕。

企業系統並不是一套乾淨利落的 API,等著 AI agent 去協調。它們大多是遺留系統,有各種怪癖、存在各種故障模式、隨時可能變動的認證流程、按時間變化的訪問頻率限制,還有一些合規要求,根本套不進簡單的提示模板里。

我的資料庫 Agent 不只是「自動執行查詢」。它還得處理連接池管理、事務回滾、只讀副本、查詢超時,並且記錄所有操作以備審計。AI 負責生成查詢語句,其他一切都靠傳統系統編程。

那些吹噓「全自動 Agent 能無縫集成你整個技術棧」的公司,要麼太樂觀,要麼根本沒真正在大規模生產環境試過。現實中,集成現實場景往往是 AI Agent 的墳墓。


親手做了12個AI Agent,我並不看好2025年的智能體! - 天天要聞

什麼才是真正可行的(以及原因)

做過十幾個覆蓋整個軟體開發生命周期的 Agent 系統後,我發現成功的項目都有共同特點:

我的 UI 生成 Agent 之所以能用,是因為每個界面都會有人審查後才上線。AI 負責將自然語言轉成可用的 React 組件,最終用戶體驗由人來把關。

我的資料庫 Agent 之所以可靠,是因為每次有破壞性的操作都會先確認。AI 負責把業務需求轉成 SQL,但數據完整性由人來保證。

我的函數生成 Agent 只在明確的邊界內工作:給它一個規範,它輸出一個函數。沒有副作用,沒有狀態管理,也沒有複雜集成。

我的 DevOps 自動化 Agent 通過生成基礎設施即代碼(IaC)來工作,這些代碼可以審查、版本控制、回滾。AI 負責把需求轉成 Terraform 代碼,但部署流程有我們多年積累的安全機制。

我的 CI/CD Agent 有明確的成功標準和回滾機制。AI 負責分析代碼質量、生成修復建議,但最後合併與否由流水線控制。

總結一句話:

AI 負責處理複雜問題,人工負責掌控關鍵決策,傳統軟體工程保障系統穩定可靠。


親手做了12個AI Agent,我並不看好2025年的智能體! - 天天要聞

我的預測

以下是我對 2025 年哪些人將陷入困境的具體預測與判斷:

  • 那些靠風險投資撐腰、打著「完全自主 Agent」旗號的初創公司,會最先碰到經濟瓶頸。他們的 Demo 在五步以內的流程還挺順,但客戶真正需要的是 20 步以上的複雜流程,這從數學上根本撐不住。為了解決這種不可能解決的可靠性問題,燒錢速度會飆升。
  • 那些在已有企業軟體產品上硬塞「AI agent」的公司,用戶接受度會停滯不前。因為他們的 Agent 根本無法深入集成,處理不了真正的工作流程。
  • 勝出者會是那些打造受限、面向特定領域的工具團隊,這些工具用 AI 處理難點,同時在人類控制或關鍵決策上保持嚴格邊界。換句話說,不是「全自動一切」,而是「能力超強且邊界清晰的助手」。
  • 市場最終會學會區分「演示效果好」的 AI 和「真正穩定可用」的 AI,而這個過程對許多公司來說代價會很高。

我並不是不看好 AI,而是對當前 Agent 架構的做法不看好。但我相信,未來會遠比現在的炒作更有價值。


親手做了12個AI Agent,我並不看好2025年的智能體! - 天天要聞

正確的構建方式

如果你打算做 AI agent,先從這些原則開始:

  • 明確界限:你的 Agent 到底能做什麼,哪些部分交給人或確定性系統處理?
  • 設計容錯:AI 出錯的情況可能占 20-40%,你怎麼應對?有沒有回滾機制?
  • 解決經濟問題:每次交互花多少錢,隨著用戶增長成本怎麼擴展?無狀態設計往往比有狀態划算。
  • 把可靠性放在自治前面:用戶更信賴穩定好用的工具,而不是偶爾能搞出神操作的系統。
  • 打好基礎:AI 負責難點(理解意圖、內容生成),關鍵環節(執行、錯誤處理、狀態管理)仍靠傳統軟體工程。

Agent 革命遲早會來,只是它絕不會像 2025 年的宣傳那樣光鮮炫目,正因為如此,它才更可能成功。

科技分類資訊推薦

引領科技豪華MPV新風尚 第二代騰勢D9西安車展亮相 - 天天要聞

引領科技豪華MPV新風尚 第二代騰勢D9西安車展亮相

兼具宜商氣度與家用溫情的科技豪華旗艦MPV,第二代騰勢D9迎來西安地區正式亮相。新車依託全球新能源MPV冠軍底蘊,以第二代刀片電池、雙閥雲輦-C、天神之眼5.0智駕等核心技術全面升級,兼顧商務體面與家庭舒適,為西北高端用戶帶來一站式全能出行解決方案。
採購禁入!科華數據材料造假被拒門外 - 天天要聞

採購禁入!科華數據材料造假被拒門外

本報(chinatimes.net.cn)記者胡雅文 北京報道這家趕上AI算力風口的公司,因投標材料造假,被相關採購方列入禁入名單兩年,其此前提出的複議申請也被正式駁回。相關採購平台近日發布公告,明確駁回科華數據股份有限公司(下稱「科華數據」,002335.SZ)此前提交的複議申請。早在一年前,科華數據已被認定在「信息通信樞紐...
快評樂道L80:15萬元級買大五座,這波值得沖? - 天天要聞

快評樂道L80:15萬元級買大五座,這波值得沖?

日前,樂道L80正式發布並開啟預售,其整車購買預售價為24.58萬元起,租電購買預售價則低至15.98萬元起。面對大型SUV市場「細分再細分」之競爭趨勢,這款樂道年度重磅新車都有哪些優勢?又能否成為「大五座SUV革新之作」?下面,圈哥就帶大家全方位感受。
成都直擊凱威德:純電全尺寸SUV的張揚與大氣 - 天天要聞

成都直擊凱威德:純電全尺寸SUV的張揚與大氣

4月22日,凱迪拉克以奧斯卡級盛典規格,將上海保利大劇院點亮為璀璨舞台,在品牌代言人倪妮與全場嘉賓的共同見證下,凱迪拉克全尺寸純電公路旗艦——凱威德耀然上市。新車共推出長續航四驅Pro、高性能四驅Ultra兩款配置,官方售價區間為46.88萬-50.88萬元。