核心概念

CUGA(Configurable Generalist Agent)是 IBM Research 開源的企業級代理 Harness,目標是消除 AI 代理應用開發中的「管道工作」(plumbing work)。開發者只需定義工具列表與系統提示詞,框架自動處理規劃→執行迴圈、狀態管理與自我修正機制。

為什麼選擇 Harness 而非 Framework?

傳統框架要求開發者從零組裝規劃器、工具呼叫器、狀態追蹤器。CUGA 的設計哲學是約定優於配置:預組裝機制包含計劃前執行(Plan-then-Execute)、CodeAct 工具執行、長期狀態追蹤、反思步驟。三種推理模式(Fast / Balanced / Accurate)依任務複雜度配置,平衡成本與延遲。模型無關性支援 OpenAI、Anthropic、watsonx、Ollama,一行環境變數切換供應商。基準測試:AppWorld 排名第 1(07/25–02/26)、WebArena 排名第 1(02/25–09/25)。

最小應用結構

agent = CugaAgent(
    model=create_llm(provider=os.getenv("LLM_PROVIDER"), model=os.getenv("LLM_MODEL")),
    tools=_make_tools(),           # 局部函數 + MCP 工具混合
    special_instructions=_SYSTEM,
    cuga_folder=str(_DIR / ".cuga"),
)

響應信封規約(可靠性關鍵)

所有工具回傳遵循標準信封格式——成功:{"ok": true, "data": {...}};失敗:{"ok": false, "code": "...", "error": "..."}。CUGA 規劃器能優雅處理聲明性失敗,20 步長任務不因異常中斷脫軌。

關鍵要點

  • 24 個單文件應用範例:涵蓋研究(Paper Scout、Wiki Dive)、日常生產力(城市簡報、旅遊規劃)、文件/媒體(PDF RAG、音視頻處理)、企業(IBM 產品 RAG)、多代理(Ouroboros 銷售線索系統,7 個專家代理)
  • 運行時治理系統(Policy System):六種策略——Intent Guard(請求前拒絕危險操作)、Tool Approval(人工批准)、Tool Guide、Playbook(固定工作流)、Output Formatter、CustomPolicy。以語義相似度(sqlite-vec)匹配觸發,存儲於 .cuga/ 實現「政策即代碼」
  • 多代理擴展路徑:CugaSupervisor(監督者模式,各專家代理隔離上下文)→ Agent Skills(SKILL.md 可復用程序知識)→ ALTK-Evolve(代理自動精煉技能的自學框架)
  • 7 個免認證 MCP 伺服器(36 個工具):web、knowledge(維基百科/arXiv)、geo、finance、code 執行、text 處理,託管於 IBM Code Engine

實務應用

從開發到生產無需重寫是最大企業價值主張。IBM Sovereign Core 部署:程式碼與本機版本完全相同,切換只需更改環境變數,模型可替換為本地 gpt-oss-120b(開源),數據不離境,OpenTelemetry + Grafana Tempo 提供完整可觀測性。

Ouroboros 多代理案例:Scout、Site Auditor、Voice-of-Customer、Person Finder、Stack Scanner、Revenue Estimator、Pitch Email Writer,新增第 8 個專家只需一行工廠程式碼。

快速入門

git clone https://github.com/cuga-project/cuga-apps.git
cd build && cp .env.example .env
docker compose up --build  # 開啟 http://localhost:8080

延伸觀點

Agent = Model + Harness 是業界正在收斂的公式(Medium/Masood 2026;IBM Research blog)。Harness 不是框架,而是包圍 LLM 推理引擎的「作業系統」層,負責 context 管理、工具派送、安全執行與 session 持久化,將概率性推理轉為確定性行動。CUGA 的設計正是這個方向的具體實現。

兩篇來源(IBM Research blog + Medium)共同指出:生產系統應偏向有界、確定性工作流(bounded, deterministic workflows),而非任意代理群集(chaotic swarms)。CUGA 的 Plan-then-Execute 架構 + Policy System 正是這一原則的落地。

「環境工程」(Environment Engineering)是值得關注的下一步趨勢:未來的方向是讓企業系統對自主代理「天然可讀」,而非強迫代理去適應敵意架構。CUGA 的 MCP 橋接與 OpenAPI 整合是先行者。結合 A2A(Agent-to-Agent)協議,多代理間的委派鏈將更標準化,與 CUGA 的 CugaSupervisor 架構方向一致。


相關頁面:AI Agent 詞彙指南:Harness、Scaffold 與 Sub-agent 層次定義 | IBM Research:超越 LLM,企業 AI 規模化的 Agent Logic 關鍵 | MagenticLite:為小型模型優化的代理系統三層架構 | Open Agent Leaderboard:通用代理系統的開放評估框架

反向連結

以下頁面引用了本頁: