核心概念
CUGA(Configurable Generalist Agent)是 IBM Research 推出的開源代理框架,核心主張是:一個 Agentic App 應該只是一個你能整個放進腦子裡的單一檔案——你只需寫工具清單和提示詞,其餘由框架接管。
這與 Harness Engineering 的思維完全一致:框架(Harness)負責規劃迴圈、工具呼叫、狀態管理、自我糾錯;開發者專注於「這個 Agent 要做什麼」而非「如何讓 Agent 跑起來」。這也是 AI Agent 術語解析:Model、Harness、Scaffold 的精確定義 中所說的核心區分——框架不是函式庫,是把重複的 orchestration 邏輯封裝成可信任的底層。
CUGA 內建三大機制:
- 長地平線規劃:透過變量追蹤與自糾正維持多步驟任務穩定性
- 多執行模式:Fast / Balanced / Accurate 三種推理強度可按任務切換
- 程式碼執行沙箱:本地、Docker/Podman 或 E2B 雲端環境,視安全需求選擇
基準測試上,CUGA 在 AppWorld(750 項真實 API 任務)排名第一、WebArena 排名第二——但 IBM 強調,這不是最重要的數字,真正的差異在治理。
關鍵要點
- 最小開發者介面:只需定義工具函數(LangChain tool / OpenAPI / MCP 皆可)+ system prompt,其餘交給
CugaAgent - 治理從建構時開始:六種策略類型——Intent Guard(攔截危險請求)、Tool Approval(執行前人工確認)、Tool Guide(引導工具使用方式)、Playbook(固定已知良好程序)、Output Formatter(強制輸出格式)、CustomPolicy——策略在代理選擇工具前就已生效,不是事後補丁
- 工具響應約定:
{"ok": true, "data": {...}}/{"ok": false, "code": "...", "error": "..."}的統一格式讓代理能優雅重規劃,而非靜默失敗 - MCP 生態:IBM 免費託管 7 個公共 MCP 伺服器(36 個工具),涵蓋網路搜尋、Wikipedia/arXiv、地理天氣、金融報價、程式工具,無需 API Key 即可使用
- 多代理委派:
CugaSupervisor→ 多個CugaAgent專家,每個專家有獨立工具集與隔離上下文——與 多 Agent 系統協作架構:MCP 與 A2A 協議 中的協調模型互補 - 主權部署:IBM Sovereign Core 架構讓代理在租戶隔離容器中運行,推理步驟全程 OpenTelemetry 追蹤,Grafana 後端保持租戶內部,零遙測外洩
- ALTK-Evolve 自主學習:
SKILL.md存儲代理從執行中學到的程序知識,按需加載,避免 prompt 過載,且每次迭代自動更新
實務應用
IBM 提供的 cuga-apps 是 24 個可運行的單一檔案範例,按場景分群:
| 群集 | 應用範例 |
|---|---|
| 研究 | Paper Scout、Wiki Dive、Web Researcher |
| 生產力 | 城市簡報、旅遊規劃、食譜助手 |
| 文件/媒體 | PDF RAG、音頻 RAG、影片 RAG |
| 運維 | 即時指標監控 |
| 企業 | IBM Cloud 架構顧問、IBM 產品文件查詢 |
| 多代理 | Ouroboros(七代理主導生成系統) |
| 瀏覽器自動化 | Meetup Finder(無頭 Chromium + Playwright) |
IBM Cloud 顧問範例說明了標準架構:CugaAgent 綁定一個 search_ibm_catalog 自訂工具 + MCP web 工具,配合 _SYSTEM 提示詞,整個 make_agent() 函數不超過 20 行。工具先搜尋真實 IBM 目錄確認服務存在,再提供建議——這是「工具即護欄」的典型應用,與 AI Agent 設計模式 中的工具設計原則一致。
快速上手:
git clone https://github.com/cuga-project/cuga-apps.git
cd build && cp .env.example .env
docker compose up --build
# http://localhost:8080
支援 OpenAI、Anthropic、watsonx、Ollama 等任意 LLM 提供商,環境變數切換,零程式碼改動。
延伸觀點
與 IBM Research:超越 LLM,企業 AI 規模化的 Agent Logic 關鍵 的論點互相呼應——IBM 的核心主張一貫是「Agent Logic」優先於模型能力。CUGA 的 24 個應用範例印證了這點:每個 App 的智能來自工具組合與提示詞設計,而非模型本身的強度。
可治理性才是企業採用的真正門檻:多數 AI 代理框架演示看起來很強,但當企業問「誰批准了這個操作?」時就崩潰。CUGA 把策略層(policy plane)放在執行層之下,讓合規不是事後加入的功能,而是架構的基礎假設。這一點 LangChain、AutoGPT 等以「功能豐富」為賣點的框架普遍缺失。
「Thin Harness, Fat Skills」的具體實踐:Thin Harness, Fat Skills — Garry Tan AI 效能架構 的口號在 CUGA 有具體實現——ALTK-Evolve 框架讓 SKILL.md 成為代理積累的程序知識庫,框架本身保持輕薄,能力藏在可更新的技能文件裡。這一模式值得在自建 Agent 系統時借鑑。
開源 MCP 伺服器降低進入門檻:IBM 免費托管的 36 個工具意味著初學者可以不用串接任何第三方 API,直接在本地部署一個可接觸真實世界(網路、維基、金融)的代理——這大幅降低了「第一個真實 Agentic App」的成本。
反向連結
以下頁面引用了本頁: