Asymetrie kvantizace KV cache
KV cache je při dlouhém kontextu jedinou bezbolestnou úsporou paměti, kterou projekt našel. Sweep přes bity, granularitu a poměr K/V na GPT-2 ukázal, že klíče potřebují víc bitů než hodnoty. Přenos na Qwen3.5 odhalil metodickou past v místě měření a ukázal, že asymetrie je regimová, ne univerzální — pod ~4 efektivními bity vyhrávají klíče výrazně, nad ~5 je volba doménová.
GPT-2 small · Qwen3.5