Google zmniejszył zużycie pamięci modeli AI sześciokrotnie, zachowując dokładność, dzięki algorytmowi TurboQuant
Krótka treść Google Research przedstawił nowy sposób kompresji pamięci KV‑cache dużych modeli językowych – TurboQuant. Algorytm zmniejsza rozdzielczość cache do 3 bitów (4 bity, j...