- 發布:2026年07月30日
- 15人觀看
商傳媒|葉安庭/綜合外電報導人工智慧模型的基準測試常被視為衡量模型效能的客觀依據,然而近期研究指出,這類評估方式存在多重局限性,其結果易受多種細節影響,對於AI研究人員和開發者而言,理解這些盲點至關重要。 根據《AI Insider》報導,IBM、Hugging Face 與慕尼黑工業大學的研究人員已指出,AI基準測試的可靠性並不高。模型評測結果受資料集、提示詞、使用工具、嘗試次數及評分方法等諸多因素影響,這些測試常未經監管,且重複使用靜態題目,導致模型可能只是記...









