- 發布:2026年03月31日
- 35人觀看
圖/本報AI製圖(示意圖)商傳媒|責任編輯/綜合外電報導Google 研究部門(Google Research)近日推出一項名為 TurboQuant 的人工智慧模型壓縮演算法,宣稱能在不犧牲準確性或無需重新訓練的情況下,大幅降低大型語言模型(LLM)關鍵記憶體「鍵值快取」(KV cache)的消耗。這項技術的發表,預計將對AI硬體設計及部署帶來深遠影響。 現今的LLM在處理長文本時,鍵值快取記憶體會隨著對話長度與上下文視窗大小呈線性增長,進而大幅增加圖形處理器(GPU)的記憶體負擔並拖...









