Google TurboQuant 讓 AI 推理成本崩盤:記憶體省 6 倍、速度快 8 倍

Share
Google TurboQuant 讓 AI 推理成本崩盤:記憶體省 6 倍、速度快 8 倍

你跟 ChatGPT 或 Gemini 聊天的時候,AI 每回一句話都要做一件很耗資源的事:記住你前面講過的所有東西。

這個「記住」的機制叫做 KV cache(key-value 快取),它是大型語言模型在推理時最大的記憶體瓶頸之一。Google Research 發表了一系列壓縮演算法,統稱為 TurboQuant,把這個瓶頸的記憶體佔用縮小 6 倍以上,注意力運算速度提升最高 8 倍,而且在基準測試中達到零精準度損失。

其中 TurboQuant 將在 ICLR 2026 發表,核心元件 PolarQuant 發表於 AISTATS 2026,另一個元件 QJL 則已發表於 AAAI。以下用白話解釋它們在做什麼。

先搞懂 KV cache 是什麼

想像你在跟一個人開會,你們講到第 30 分鐘了,這時候對方問你一個問題,你需要回想前面 30 分鐘所有人說過的話、做過的決定,才能給出一個合理的回答。

AI 模型也一樣,當你跟它對話到第 50 句的時候,模型需要「回想」前面 49 句的內容才能理解第 50 句的語境。KV cache 就是那個「會議紀錄」,它把每一句話處理過的中間結果(key 和 value 向量)存起來,讓模型不用每次都重新讀一遍所有對話。

問題是這份會議紀錄非常佔空間,每一句話都要存成高維度的向量(想像成一個有幾千個數字的清單),對話越長,KV cache 越大。一個長對話下來,KV cache 可能佔掉整個 GPU 記憶體的大部分。

這就是為什麼你跟 AI 聊太久,它有時候會「忘記」前面的內容,或者回覆速度變慢,因為記憶體不夠了。

TurboQuant 怎麼壓縮這份會議紀錄

TurboQuant 的做法可以想成兩個步驟,一個負責壓縮,一個負責修正誤差。

第一步(PolarQuant):換一種方式記錄。

原本 KV cache 裡的每個向量都用「直角座標」存(想成 X、Y、Z 三個軸的距離),這種存法需要很多位元才能精確。PolarQuant 先對向量做隨機旋轉(preconditioning),再轉成「極座標」(想成距離加上角度)。

為什麼這樣比較好壓?因為旋轉後,角度的分布會變得高度集中且可預測,可以直接映射到一個固定的「圓形網格」上壓縮,不需要傳統方法中額外的正規化(normalization)步驟,也不需要依賴資料本身來建立編碼簿。

第二步(QJL):用 1 個位元修正誤差。

壓縮一定會有誤差,PolarQuant 壓完之後還是有一些微小的偏差。QJL(Quantized Johnson-Lindenstrauss,名字來自一個數學定理)用一種很聰明的方式來修正:它只用 1 個位元(正或負,+1 或 -1)來記錄殘差,幾乎不佔額外空間,但能把誤差消除到可以忽略的程度。

兩步加在一起,TurboQuant 可以把 KV cache 從 32 位元壓到只剩 3 位元,實際記憶體節省 6 倍以上(位元數的壓縮比和實際記憶體節省不完全等價,因為有額外開銷,Google 原文一致使用 6 倍這個數字),而且不需要重新訓練模型,直接套用就好。

數字有多誇張

Google 在 Llama-3.1-8B-Instruct、Gemma、Mistral 三個開源模型上測試,用了 LongBench、Needle In A Haystack、ZeroSCROLLS 等多個基準測試。結果:

  • KV cache 記憶體縮小 6 倍以上
  • 在 NVIDIA H100 GPU 上,4 位元 TurboQuant 的注意力運算比 32 位元快 8 倍
  • 在測試的所有下游任務中精準度 零損失
  • 在 Needle In A Haystack(大海撈針)測試中,特定模型和配置下達到 完美分數
  • 不需要訓練、不需要微調
  • 執行時額外的計算開銷 可忽略不計

「零損失」這三個字是最關鍵的,過去很多壓縮方法都會在壓縮和精準度之間做取捨,壓得越小答案越不準。TurboQuant 在基準測試中壓到 3 位元還是零損失(原文對 PolarQuant 的描述是「nearly loss-less」,近乎無損),這如果在更大規模的部署中被驗證,對整個 AI 推理產業的影響會非常大。

這對你有什麼影響

講幾個直接的後果,每一個都跟你有關。

對話可以更長。 目前很多 AI 產品的對話長度受限於 KV cache 的記憶體大小。記憶體縮小 6 倍代表同樣的硬體可以支持更長的對話、更大的上下文視窗。

推理成本下降。 AI 公司最大的成本之一就是 GPU 記憶體。同樣的 GPU 可以同時服務更多使用者(因為每個使用者的 KV cache 更小了),單位成本下降。

邊緣裝置上跑 AI 變得更可行。 手機、筆電上的 AI 最大的限制就是記憶體不夠。KV cache 縮小 6 倍代表更大的模型可以塞進更小的裝置。

搜尋引擎變快。 Google 在論文中特別提到 TurboQuant 對搜尋和 AI 應用有「深遠影響」。KV cache 壓縮不只用在聊天機器人,任何需要處理長序列的 AI 任務都會受益,包括搜尋引擎的排名和摘要生成。

一句話總結

Google 找到了一種方法,讓 AI 的「短期記憶」佔用的空間縮小 6 倍、注意力運算快 8 倍,而且在測試中不忘任何細節。這是把 AI 從資料中心推向每個人手上的關鍵一步。


相關資料:

Read more

Saronic 的無人船六月救人、七月炸港,四天後宣布蓋 32 億美元造船廠

Saronic 的無人船六月救人、七月炸港,四天後宣布蓋 32 億美元造船廠

2026 年 6 月 9 日凌晨,一架 AH-64 阿帕契攻擊直升機墜落在阿曼外海,把兩名飛行員從水裡撈起來的,是一艘 7.3 公尺長、船上沒有人的無人水面載具(USV)。美軍第五艦隊第 59 特遣隊把這艘船開過去,這是美軍第一次公開確認在實戰環境用無人船救回機組員。 一個月又三天之後,7 月 12 日晚間,三艘外型一模一樣的船從波斯灣出發,一路開進伊朗班達阿巴斯(Bandar Abbas)海軍基地,撞上潛艦與艦艇維修設施引爆。美軍中央司令部隔天證實,這是美軍第一次在實戰中使用海上攻擊無人艇。 同一款船,同一條產線,任務決定它今天是救生艇還是彈藥。這款船叫 Corsair,做的公司叫 Saronic Technologies,2022 年才在德州奧斯汀成立。 而就在四天前的 7 月 16 日,這家成立四年的公司宣布要在德州布朗斯維爾(

By Fox Hsiao
Archer、Anduril 與 Thunder:一套電動飛行技術,如何同時吃下奧運與戰場

Archer、Anduril 與 Thunder:一套電動飛行技術,如何同時吃下奧運與戰場

2026 年 7 月 20 日,一家叫 Archer 的公司同時活在兩個世界。在其中一個世界,它是 2028 洛杉磯奧運的獨家空中計程車供應商,要讓乘客從塞車地獄裡直接飛過去;在另一個世界,它跟國防科技公司 Anduril 一起,亮出一架要陪著阿帕契(Apache)攻擊直升機上戰場的自主攻擊旋翼機 Thunder。 這架 Thunder 跟 Anduril 共同開發,用的是一個全新設計的自主垂直起降平台,而同一個平台還有一個商用版,叫 Halo,一個做國防、一個做民用。Archer 本來最出名的是載客用的空中計程車 Midnight,如今卻同時把觸角伸進戰場。一家幫奧運載客的新創,怎麼會突然做起攻擊無人機,這條線一路追下去,會牽出 Anduril 一個很少被講清楚的成長祕密。 Archer 本來是一家賣「飛天計程車」的公司 先把 Archer 是誰講清楚,

By Fox Hsiao
前 CIA 局長在《外交事務》說明,台灣需要讀懂的事:主權國防戰略生態系

前 CIA 局長在《外交事務》說明,台灣需要讀懂的事:主權國防戰略生態系

裴卓斯(David Petraeus)指揮過駐伊拉克與阿富汗聯軍、當過美國中央司令部司令,退役後接掌 CIA。7 月初,他和在烏克蘭營運 AI 非營利組織的 Clara Kaluderovic 在《外交事務》(Foreign Affairs)合寫了一篇文章,標題就點名台灣,〈台灣一直沒學到的烏克蘭課〉,副標是「問題不在無人機,在無人機周圍的一切」。 文章的出發點,是擔心各國軍方把烏克蘭戰場讀成一份採購目錄。無人機便宜又有效,那就編預算買無人機,看起來這樣學最快,但兩位作者認為這樣只學到皮毛,烏克蘭真正的本事,是圍繞這些便宜武器搭起來的整套生態系,而他們判斷最可能錯過這一課的地方,正是同樣面對強鄰入侵威脅的台灣。 烏克蘭真正的武器是生態系 這套生態系怎麼運作,黑海看得最清楚,2022 年 2 月開戰時,烏克蘭為了不讓旗艦落入俄軍手中,自己把它鑿沉,等於一開戰就沒有海軍。兩年之內,這個沒有海軍的國家把俄軍黑海艦隊逐出塞凡堡母港,摧毀、重創超過三分之一的黑海艦艇,剩下的船只能躲到離烏克蘭最遠的港口,做法是空中無人機負責找船、

By Fox Hsiao
68 歲拒絕交棒、全押 AI:孫正義要讓 SoftBank 衝上 1,000 兆日圓

68 歲拒絕交棒、全押 AI:孫正義要讓 SoftBank 衝上 1,000 兆日圓

六月二十四日,孫正義(Masayoshi Son)站上 SoftBank 第四十六屆股東會的講台,沒有先講財報數字,而是先講了一隻鵝。十六年前,這隻鵝在市場眼中的價值是零。 這場股東會的氣氛,跟一個多月前那場財報說明會不太一樣。五月那場是財務長後藤芳光主講,孫正義因為膝蓋還在復原沒上台。這次他自己來了,講了快一個半小時,從一隻會下金蛋的鵝講到他父親臨終前的最後一句話,中間夾著一個聽起來像天文數字的目標,一千兆日圓。 十六年前,那隻鵝值零元 孫正義用的是大家從小就聽過的那個寓言,會下金蛋的鵝。他把一顆金蛋換算成一兆日圓,然後帶大家回到十六年前。 那是 2010 年,SoftBank 創立三十週年,他在股東會上發表「新三十年願景」。當時集團的持股權益價值是五兆日圓,等於五顆金蛋,扣掉兩兆日圓的負債,股東淨值(NAV)剛好三兆日圓,也就是三顆金蛋。問題出在另一個數字上,當年 SoftBank 的市值也是三兆日圓,跟淨值一模一樣。 這代表什麼?孫正義的帳是這樣算的,淨值已經把帳上看得到的三顆蛋算進去了,市值卻只值三顆蛋的錢,那麼會下蛋的這隻鵝本身,

By Fox Hsiao