Hatteria Labs

Výzkum

Co jsme zjistili — včetně toho, co nevyšlo.

Jazykové modely zkoumáme tak, že se je pokoušíme cíleně rozbít a měříme, co se stane. Všechno tady je vlastní práce, běžená na vlastním hardwaru a publikovaná s kontrolami, které musela porazit.

KvantizaceKV cache

Asymetrie kvantizace KV cache

KV cache je při dlouhém kontextu jedinou bezbolestnou úsporou paměti, kterou projekt našel. Sweep přes bity, granularitu a poměr K/V na GPT-2 ukázal, že klíče potřebují víc bitů než hodnoty. Přenos na Qwen3.5 odhalil metodickou past v místě měření a ukázal, že asymetrie je regimová, ne univerzální — pod ~4 efektivními bity vyhrávají klíče výrazně, nad ~5 je volba doménová.

GPT-2 small · Qwen3.5

Komprese modelůTransformery

Sdílené funkční báze napříč vrstvami transformeru

Devítidílný řetěz testů zkoumal, zda vrstvy transformeru GPT-2 sdílejí dost parametrické struktury na to, aby šlo uložit jeden společný základ a per-layer jen levný popis odchylky. Sdílení ve váhách se nepotvrdilo, ve funkčním prostoru vstupních aktivací ano — ale jen skrze dotrénování, ne analytickou projekci. Attention matice se kompresi poddávají (9,6× za obnovitelnou cenu), MLP vrstvy jí strukturálně odolávají.

GPT-2 small · GPT-2 medium