量化即服務:我們將開源模型從 16 位元無損量化到 3 位元。把任何模型交給我們,取回一個基準表現不變、記憶體與推理成本僅為一小部分的模型。
模型的成長速度,是硬體變便宜速度的 10 倍。
瓶頸不在算力 — 而是記憶體。
既有的啟發式方法無法善用最佳的記憶體感知表示 — 白白浪費了效能與成本節省的空間。
對每一層一視同仁,會在容易的部分浪費精度,並破壞困難的部分。
最強的 AI 模型對多數硬體來說太過龐大。記憶體才是真正的瓶頸。
壓縮過頭,品質就會斷崖式下滑。其實有更聰明的方式達到相同尺寸。
相同的基準測試。相同的行為。無損 — 體積僅為原來的一小部分。
import invariant
model = invariant.load("meta-llama/Llama-3-70B")
compressed = model.compile(target_bits=4.0)
量化即服務:三行程式碼 — 或直接把模型交給我們。
我們探測損失景觀,找出模型中哪些部分脆弱、哪些部分穩健。
敏感的層獲得更多位元,穩健的層獲得較少位元。總大小不變 — 品質卻提升。
壓縮後,我們依據敏感度圖修復剩餘失真 — 消除連鎖累積的誤差。
到 HuggingFace 搜尋別人已經跑過的啟發式量化結果,期待參數設定還算合理。
評估是否仍符合任務需求與記憶體限制。通常都不符合。
手動調參、重新執行、重新評估。一直重複,直到結果勉強可接受。
耗費數天反覆迭代後,你得到「還行」的結果 — 卻沒有任何證據證明它是最佳解。
對標當前最先進的壓縮方法所做的基準測試。
Flower Forest Intelligence、Higgsfield AI 與牛津大學,都信任 Invariant 將模型從 16 位元無損量化到 3 位元。
中國・杭州
哈薩克・阿拉木圖
英國・牛津
有些層位於損失景觀的陡峭山脊上 — 即使是微小變動,也會讓品質大幅下降。其他層則位於平坦的山谷之中,即使大幅壓縮也幾乎不會有任何後果。
我們直接量測這種曲率,再用它來決定每一個精度位元該分配到哪裡。最終結果:模型體積大幅縮小,行為卻幾乎與原始模型一致。

共同創辦人兼執行長

共同創辦人兼技術長

董事長
亞太區銷售總監
亞太區業務發展總監
別再為 16 位元的記憶體付出 16 位元的成本。量化即服務 — 數天內即可投入生產,而非數季。