共 36 篇文章包含此標籤
心理健康對話不是只有「有沒有觸犯禁令」的二元問題:從日常壓力、關係困擾到明確危機,模型都得理解脈絡、尊重使用者自主性,並
工具型 LLM Agent 不只回答問題,還會搜尋、寫程式、讀取環境資訊並連續採取動作;這也讓它有機會不解決任務本身,卻
一個 AI Agent 曾經完成任務,不代表它下次仍會完成。Hugging Face 與 IBM Research 以
Google DeepMind 於 2026 年 8 月 27 日發布〈Piloting the world's fir
2026 年 7 月 8 日,OpenAI 發布分析報告《Separating Signal from Noise in
AI 評測正面臨「數據分裂」危機:同一個模型在同一個基準上,由不同機構跑出的分數可能相差超過 14 分。LLaMA 65
GeneBench-Pro 是 OpenAI 於 2026 年 6 月 30 日發佈的新一代計算生物學 AI 評測基準,
GeneBench-Pro 是 OpenAI 於 2026 年 6 月 30 日發布的科學研究 AI 基準框架,評估 A
ScarfBench 是 IBM Research 發布的開放基準測試平台,專門評估 AI 代理在**企業 Java 框
ScarfBench 是 IBM Research 於 2026 年 6 月發布的開放基準,專門評估 AI 代理在企業級
FFASR(Far-Field ASR)Leaderboard 是由 Treble Technologies 與 Hug
程式碼代理(code agent)正越來越多地取代人類直接使用軟體函式庫:它們接收任務描述、選擇函式庫、撰寫呼叫程式碼、
2026 年 6 月 17 日,OpenAI 發布 LifeSciBench——一套由生命科學領域頂尖專家親自撰寫並審核
ITBench-AA 是首個針對**企業 IT 代理任務**設計的評估基準,由 Artificial Analysis
IBM Research 於 2026 年 5 月 18 日在 Hugging Face 發布 **Open Agent
2026 年 5 月 20 日,Gartner 發布首份「企業 AI 編碼代理魔力象限」(Magic Quadrant
2026 年 3 月,OpenAI 發起「Parameter Golf」競賽,規則只有兩條硬性限制:模型大小不得超過 *
2026 年 5 月,Databricks 與 OpenAI 宣布深度合作,將 **GPT-5.5** 正式整合進 Da
AI Agent 越來越常在社交情境中代表使用者行事——管理行事曆、協商購買、與其他 Agent 互動。這不只需要任務能