量化即服務 QaaS

AI 精度
編譯器

量化即服務:我們將開源模型從 16 位元無損量化到 3 位元。把任何模型交給我們,取回一個基準表現不變、記憶體與推理成本僅為一小部分的模型。

一項服務,涵蓋所有主流開源模型家族

模型的成長速度,是硬體變便宜速度的 10 倍
瓶頸不在算力 — 而是記憶體

現今的壓縮方法千篇一律

既有的啟發式方法無法善用最佳的記憶體感知表示 — 白白浪費了效能與成本節省的空間。

盲目壓縮

對每一層一視同仁,會在容易的部分浪費精度,並破壞困難的部分。

模型放不下

最強的 AI 模型對多數硬體來說太過龐大。記憶體才是真正的瓶頸。

📈

品質懸崖

壓縮過頭,品質就會斷崖式下滑。其實有更聰明的方式達到相同尺寸。

同一個模型。極小的尺寸。

原始
14 GB
70 億參數 · fp16
編譯後
5.2 GB
平均 3.8 位元 · 混合精度

相同的基準測試。相同的行為。無損 — 體積僅為原來的一小部分。

根本不同的工作流程

import invariant

model = invariant.load("meta-llama/Llama-3-70B")
compressed = model.compile(target_bits=4.0)

量化即服務:三行程式碼 — 或直接把模型交給我們。

01

映射敏感度

我們探測損失景觀,找出模型中哪些部分脆弱、哪些部分穩健。

02

分配精度

敏感的層獲得更多位元,穩健的層獲得較少位元。總大小不變 — 品質卻提升。

03

修正誤差

壓縮後,我們依據敏感度圖修復剩餘失真 — 消除連鎖累積的誤差。

01

找一個已量化的模型

到 HuggingFace 搜尋別人已經跑過的啟發式量化結果,期待參數設定還算合理。

02

檢查品質是否符合

評估是否仍符合任務需求與記憶體限制。通常都不符合。

03

自己調整啟發式參數

手動調參、重新執行、重新評估。一直重複,直到結果勉強可接受。

仍無任何保證

耗費數天反覆迭代後,你得到「還行」的結果 — 卻沒有任何證據證明它是最佳解。

探索取捨關係

拖動滑桿,看品質如何隨著壓縮程度變化。我們的方法能讓品質維持得更久。

4.2
平均位元數
96%
品質保留率
0.38x
尺寸縮減

更小,卻同樣強悍的模型

對標當前最先進的壓縮方法所做的基準測試。

0
每權重平均位元數
0
保留的原始品質
0
記憶體縮減倍數
0
推論加速倍數

客戶遍及三大洲

Flower Forest Intelligence、Higgsfield AI 與牛津大學,都信任 Invariant 將模型從 16 位元無損量化到 3 位元。

牛津大學 英國・牛津 Higgsfield AI 哈薩克・阿拉木圖 Flower Forest Intelligence 中國・杭州
客戶

Flower Forest Intelligence

中國・杭州

客戶

Higgsfield AI

哈薩克・阿拉木圖

客戶

牛津大學

英國・牛津

並非所有參數
都生而平等

有些層位於損失景觀的陡峭山脊上 — 即使是微小變動,也會讓品質大幅下降。其他層則位於平坦的山谷之中,即使大幅壓縮也幾乎不會有任何後果。

我們直接量測這種曲率,再用它來決定每一個精度位元該分配到哪裡。最終結果:模型體積大幅縮小,行為卻幾乎與原始模型一致。

由原研究團隊親手打造

Diego Granziol

Diego Granziol 博士

共同創辦人兼執行長

Khurshid Juraev

Khurshid Juraev

共同創辦人兼技術長

Jon Keating

Jon Keating 教授

董事長

Oscar Wang

Oscar Wang

亞太區銷售總監

Stephen Lin

Stephen Lin

亞太區業務發展總監

你的模型。3 位元。
無損。

別再為 16 位元的記憶體付出 16 位元的成本。量化即服務 — 數天內即可投入生產,而非數季。

立即量化你的模型