核心概念
Hugging Face 工程師在主力 API 服務中斷後意識到供應商鎖定的脆弱性,轉而用本地開源模型建立 GitHub issue 與 PR 的即時分類通知系統。核心目標:近實時、無速率限制、成本僅電費。
問題背景
OpenClaw 是一個開源 AI 代碼編輯器,其倉庫每天產生大量 issue 和 PR。舊方案依賴外部 API 批量處理(每 2-6 小時一批),受速率限制且延遲高。新目標是 issue 出現後數秒內完成分類並通知相關人員。
分類標籤體系
系統使用 6 個核心標籤進行多標籤分類:
local_models:本地模型相關議題self_hosted_inference:自架推論服務acp:Agent Communication Protocol 相關agent_runtime:Agent 執行環境codex:編程 Agent 整合ui_tui:使用者介面
技術架構
兩個核心組件
localpager-agent:基於 Pi 框架的 Agent,限制為只讀操作和分類輸出,是整個系統的協調核心。
reposhell:受限的 bash 殼層,允許 Agent 主動查詢代碼庫上下文,但禁止所有寫入與網路操作:
# 允許的命令
reposhell bound cwd=/repo/openclaw
> head README.md
> cat extensions/kimi-coding/package.json
> git grep "tool_call"
# 拒絕的操作
> curl localhost # policy denied: unsupported command
關鍵設計哲學:Agent 不是被動接受所有資訊,而是主動決定需要查詢哪些上下文,再提交結構化 JSON 分類結果。這是傳統靜態分類器和完整自主 Agent 之間的務實中間路徑。
完整資料流
GitHub 事件 → gitcrawl 本地鏡像 → SQLite + 分類佇列
↓
Worker 渲染 prompt → localpager-agent
↓(可選:reposhell 查詢代碼庫)
final_json(結構化輸出)→ SQLite → Discord 通知
關鍵要點
- Gemma-4-26b(NVFP4 量化):並發 16 時聚合 402 tokens/sec,330 筆測試集約 7.5 分鐘完成,召回率 0.905 但假正例多(227 個),適合高吞吐場景
- Qwen3.6-35b:假正例降至 105 個,F1(0.824)略高,但吞吐量低三倍(145 tokens/sec),適合精確度優先場景
- DeepSeek-V4-Flash(284B MoE):假正例僅 30 個、精確度 0.938,但吞吐量只有 13 tokens/sec,無法達成實時目標
- 代理式主動查詢:允許模型讀取 package.json、git 記錄後更正初始錯誤判斷,是純 prompt 分類器做不到的
- 驗證成本幾乎為零:每 2 小時用 GPT-5.5 做裁判交叉驗證,約 40k tokens(多數命中快取),月度成本 ~$9
性能對比
| 模型 | 精確度 | 召回率 | F1 | 假正例 | 牆鐘時間/行 |
|---|---|---|---|---|---|
| Gemma-4-26b | 0.716 | 0.905 | 0.800 | 227 | 1.41 秒 |
| Qwen3.6-35b | 0.831 | 0.818 | 0.824 | 106 | 13.51 秒 |
| DeepSeek-V4-Flash | 0.938 | 0.714 | 0.811 | 30 | 144 秒 |
實務應用
PR 分類案例
PR #84621(Fix Kimi tool-call rewriting stop reason handling):
- Agent 初始判斷:路徑含
extensions/kimi-coding,傾向coding_agent_integrations - Agent 主動查詢:
cat extensions/kimi-coding/package.json - 讀到套件名稱
@openclaw/kimi-provider,確認為推論 API 插件而非編碼 Agent - 最終分類更正:
inference_api+tool_calling,排除coding_agent_integrations
可擴展應用場景
相同架構可直接套用於:客服票據分類、內容審核申訴、新聞垂直過濾、銷售線索篩選、學術論文主題標記。共通點都是「需要查詢額外上下文才能精確分類」的任務。
模型選型建議
| 需求優先 | 推薦 |
|---|---|
| 高吞吐、可接受假正例 | Gemma-4-26b(NVFP4,concurrency 16) |
| 高精確、接受較慢速度 | Qwen3.6-35b |
| 離線批次、最高精確度 | DeepSeek-V4-Flash |
延伸觀點
學術研究從兩個方向補充了這篇實踐報告的盲點。
1. 代碼品質作為分流信號
arXiv 2604.07494(Triage,2026)提出「層級相依非對稱性」:乾淨代碼可以交給小模型處理,混亂複雜的代碼需要大模型。這與本文的多模型組合策略一致,但提供了更嚴謹的路由框架——不只是靜態選擇模型,而是根據任務特徵動態路由。在 SWE-bench Lite(300 任務)上,代碼健康指標能有效預測哪些任務適合便宜模型。
2. 多 Agent 協作顯著降低誤報
CORTEX(arXiv 2510.00311)在資安告警分類場景中發現,專門角色的多 Agent 協作相比單一 LLM,F1 從 0.66 提升至 0.78(+12%),誤報率從 24.9% 降至 14.2%。這與本文 Gemma 假正例高達 227 個的困境高度相關——若將「查詢上下文」、「推理」、「輸出分類」拆成獨立 Agent,精確度可能進一步提升,代價是延遲和 token 消耗大幅增加(CORTEX 報告增加 468%)。
整合洞察:零成本本地分類是可行的 MVP,但若要降低假正例、提升可審計性,下一步應考慮任務路由(小任務走小模型)+ 多 Agent 協作驗證(低信心判斷交給第二個 Agent 複核)的混合架構。
相關頁面:Holo3.1:本地電腦操作代理的量化推論突破 | vLLM V0 升級 V1:強化學習訓練的後端正確性優先原則 | Is It Agentic Enough:Hugging Face 開源模型代理基準測試框架 | Project Ire:LLM 驅動的自主惡意軟體行為分類代理
反向連結
以下頁面引用了本頁: