- 發布:2026年05月21日
- 27人觀看
商傳媒|方承業/綜合外電報導美國AI公司actAVA.ai於週三發布全球首個針對人工智慧(AI)代理在醫療領域長程應用所設計的基準測試CHI-Bench,結果顯示,來自Anthropic、OpenAI及谷歌(Google)等主要業者所開發的頂尖AI模型,在美國實際醫療工作流程中,有高達72%的機率無法順利完成任務。 CHI-Bench基準測試涵蓋75個醫療工作流程及30個前沿AI代理,每個測試案例模擬4至6個臨床階段,包含60至80個步驟,並透過超過200種醫療協調流程(MCP)工具和一份厚達1,279頁的操作手...









