Abychom z jazykového modelu dostali jediné slovo, musíme z paměti načíst 300 GB parametrů. Pro každé jedno slovo zvlášť. Proč je autoregresivní token tak drahý, jak na něj útočí JEPA či difuze a proč se chystá výměna motoru za jízdy?

Abychom z jazykového modelu dostali jediné slovo, musíme z paměti načíst 300 GB parametrů. Pro každé jedno slovo zvlášť. Proč je autoregresivní token tak drahý, jak na něj útočí JEPA či difuze a proč se chystá výměna motoru za jízdy?