Google opísal autofinetune na Cloud TPU: agentické post-training slučky pre SFT a GRPO

Google Developers Blog 11. septembra 2026 predstavil projekt autofinetune: agentický workflow pre post-training LLM na Cloud TPU s Tunix, Gemma a pomocnými nástrojmi. Podklad ukazuje mechanizmus automatizovaných experimentov pre SFT aj GRPO, no výkonové zlepšenia sú doložené len ako tvrdenia pôvodcu v ukážkových behoch.

AI ilustrácia: Google opísal autofinetune na Cloud TPU: agentické post-training slučky pre SFT a GRPO
AI ilustrácia vytvorená pre AI INDUSTRY. Nezobrazuje skutočné zariadenie, prevádzku ani produkt.

Google vo svojom technickom blogu 11. septembra 2026 predstavil projekt autofinetune, ktorým prenáša agentické „autoresearch“ slučky z oblasti pre-trainingu do LLM post-trainingu. Podľa textu ide o workflow postavený na nástrojoch Tunix, Gemma, Cloud TPU, orchestrace cez Antigravity CLI a modeli Gemini Flash 3.7 ako agentovi, ktorý iteruje nad tréningovým skriptom a vyhodnocuje výsledky.1

Čo sa mení oproti ručnému ladeniu

Blog opisuje pomerne konkrétny mechanizmus. Človek najprv pripraví súbor program.md, kde určí hranice experimentu, metriky a obmedzenia. Druhým vstupom je run.py, teda samostatný finetuning skript. Agent potom podľa Google opakovane upravuje run.py, spúšťa tréningové joby, meria cieľovú metriku, zachováva víťazné commity, regresie vracia späť a výsledky zapisuje do results.tsv.1

Praktický význam tejto zmeny je v tom, že blog nehovorí len o jednom „AI pomocníkovi“, ale o uzavretej slučke pre sériu experimentov. Pre tímy, ktoré dnes manuálne skúšajú LoRA rank, learning rate, batch size či plán warmupu, je dôležité najmä to, že Google opisuje automatizáciu celého cyklu od zmeny konfigurácie po vyhodnotenie a správu verzií.1

Dve ukážky: SFT a GRPO

Prvá prípadová štúdia sa týka supervised fine-tuningu modelu google/functiongemma-270m-it na datasete google/mobile-actions. Google uvádza hardvér Cloud TPU v5e-1, približne niekoľkominútové iterácie, spolu 20 automatizovaných experimentov počas niekoľkých hodín a cieľovú metriku presnosti generovania function callov. Zároveň boli v program.md povolené zásahy do parametrov ako LoRA rank/alpha, cieľové projekčné vrstvy, learning rate, warmup/decay, optimizer, gradient clipping, batch size a seed; zmeny datasetu, počtu epoch a architektúry modelu naopak povolené neboli.1

Druhá ukážka posúva workflow do reinforcement learningu cez GRPO. Blog hovorí o oficiálnom príklade z repozitára Tunix, kde sa trénuje Gemma 3 1B na úlohách matematického uvažovania s datasetom GSM8K. Tu Google uvádza Cloud TPU v6e-1, iterácie v rozsahu niekoľkých hodín a 40 experimentov počas 2 až 3 dní. Vonkajšia optimalizácia bola podľa zdroja zjednodušená na umelú metriku Post_RL_metric = numerical_accuracy + format_accuracy.1

Čo je doložené a čo nie

Najsilnejšou časťou podkladu je opis mechanizmu: vstupy, hranice zásahov, typy parametrov aj evidencia výsledkov sú pomenované konkrétne. To je užitočné pre inžinierov, ktorí chcú podobný workflow postaviť nad vlastným tréningovým skriptom.1

Opatrnejšie treba čítať výkonové tvrdenia. Google pri RL ukážke píše, že agent našiel lepšie LoRA konfigurácie, rollout temperature, KL penalty či system prompt a zlepšil celkovú odmenu asi o 10 %. V tomto balíku však ide len o tvrdenie pôvodcu z ukážkového behu; podklad neposkytuje nezávislé overenie, rozptyl medzi behmi ani porovnanie mimo Google stacku.1

Rovnako dôležité je nepliesť si tento blog s oznámením široko dostupného produktu. Zdroj spoľahlivo dokladá technický opis projektu a dvoch demonštračných scenárov na Cloud TPU, nie všeobecne overený štandard pre post-training LLM naprieč infraštruktúrami.1

Technický kontext

Stav overenia: Spracované podľa zdroja; redakcia postup nereprodukovala.

Verzie: Gemini Flash 3.7, Gemma 3 1B, Cloud TPU v5e-1, Cloud TPU v6e-1

Dátum pôvodného zdroja: 11. septembra 2026

Podmienky použitia: Podklad predpokladá workflow pre LLM post-training so súborom program.md na definovanie hraníc experimentu, samostatným tréningovým skriptom run.py a prístupom ku Cloud TPU. Opisované príklady používajú Tunix a modely Gemma.

Obmedzenia: K dispozícii je jediný primárny vendorový zdroj. Výsledky v SFT a GRPO sú opísané ako ukážkové behy bez nezávislej validácie, bez štatistiky variability a bez potvrdenia reprodukovateľnosti mimo Google stacku. RL príklad používa umelú metriku Post_RL_metric, takže nejde o všeobecný benchmark odvetvia. Dostupnosť sľubovaného kódu a repozitára nie je v tomto balíku samostatne overená.

Claims → evidence

Tvrdenia a ich podklady

Percentá vyjadrujú redakčný odhad modelu, nie nezávisle nameranú pravdepodobnosť pravdivosti. Tvrdenia môžete porovnať s uvedenými zdrojmi.

99%
Google Developers Blog publikoval 11. septembra 2026 text o projekte autofinetune pre autonómny LLM post-training na TPU.Zdroje: Google Developers Blog
96%
Podľa blogu autofinetune používa Google AI stack pozostávajúci z Tunix, Gemma, Cloud TPU, Antigravity CLI a Gemini Flash 3.7.Zdroje: Google Developers Blog
97%
Google opisuje workflow, v ktorom človek definuje hranice a hodnotenie v program.md, poskytne tréningový skript run.py a agent potom upravuje skript, spúšťa joby, meria metriku, ponecháva víťazné commity alebo vracia regresie a zapisuje výsledky do results.tsv.Zdroje: Google Developers Blog
96%
V SFT prípadovej štúdii Google uvádza model google/functiongemma-270m-it, dataset google/mobile-actions, hardvér Cloud TPU v5e-1, približne 20 automatizovaných experimentov počas niekoľkých hodín a metriku presnosti generovania function callov.Zdroje: Google Developers Blog
97%
Pri SFT boli podľa blogu povolené zmeny parametrov ako LoRA rank/alpha, cieľové projekčné vrstvy, learning rate, warmup/decay, optimizer, gradient clipping, batch size a seed, zatiaľ čo dataset, počet epoch a architektúra modelu meniť nebolo dovolené.Zdroje: Google Developers Blog
95%
V RL prípadovej štúdii blog uvádza oficiálny GRPO príklad z repozitára Tunix pre Gemma 3 1B na datasete GSM8K, hardvér Cloud TPU v6e-1, iterácie trvajúce niekoľko hodín a 40 experimentov počas 2 až 3 dní.Zdroje: Google Developers Blog
95%
Google píše, že vonkajšia optimalizácia v RL ukážke používala jedinú umelú metriku Post_RL_metric definovanú ako numerical_accuracy plus format_accuracy.Zdroje: Google Developers Blog
84%
Blog tvrdí, že agent v RL ukážke našiel lepšie konfigurácie vrátane LoRA parametrov, rollout temperature, KL penalty a system promptu a zlepšil celkovú odmenu približne o 10 %, no v podklade ide o tvrdenie pôvodcu z ukážkového behu.Zdroje: Google Developers Blog

Zdroje a atribúcie

Na ďalšie overenie

  1. Google Developers Blog ↗Autonomous LLM post-training with Tunix on TPUs - Google Developers Blog · podklad načítaný 15. septembra 2026