Radar · 15/07/2026 · fatto del 14/07/2026 · ricerca

Un agente RL addestra modelli con RL per 1300 dollari

Un progetto open source su GitHub ha addestrato un agente AI (basato su Qwen3.6-35B con LoRA) a scrivere configurazioni di training complete per modelli più piccoli, usando reinforcement learning in entrambi i loop. L’agente riceve una descrizione del task (“insegna a un modello a risolvere query multi-hop su personaggi”), scrive l’ambiente, la funzione di reward, il dataset e gli iperparametri, e lancia il job su GPU Runpod. Il reward dell’agente dipende da quanto bene il modello addestrato performa su una valutazione nascosta.

Il costo totale del training dell’agente è stato di circa 1300 dollari. Il progetto ha aperto tutto: i pesi dell’agente (adattatore LoRA su Hugging Face), il codice di orchestrazione GPU, le famiglie di task, il codice delle reward, e i resoconti dettagliati di ogni tentativo, inclusi i fallimenti. L’agente è passato da reward ~0.0 a un picco di ~0.63 in 54 step, e ha mostrato capacità di trasferimento su task mai visti durante il training.

Perché ti riguarda: fino a pochi mesi fa, questo tipo di meta-apprendimento era territorio di lab di ricerca. Ora il costo è alla portata di chi vuole sperimentare seriamente, e l’infrastruttura per agenti che addestrano modelli si sta democratizzando. Il progetto dimostra che puoi costruire un ciclo completo di training agentico con risorse accessibili, e che la trasparenza sul processo (fallimenti compresi) fa la differenza per chi impara.

Nel dettaglio

Come funziona

Due loop RL separati, due stack di training diversi. Nel loop esterno, l’agente trainer (Qwen3.6-35B con LoRA) viene addestrato con Tinker e il cookbook di importance-sampling GRPO. Un episodio consiste nel ricevere una specifica di task, lavorare su un workspace tramite tool di file editing, e sottomettere un job completo. Il reward dell’episodio è lo score del modello addestrato su una valutazione nascosta.

Nel loop interno, il modello piccolo (Qwen3-0.6B o 1.7B) viene addestrato sul task con prime-rl (GRPO) su GPU Runpod, usando la configurazione scritta dall’agente: ambiente di verifica, rubrica di valutazione e config TOML.

Cosa ha imparato

Il reward è salito in due gradini distinti. L’agente ha imparato a scegliere il modello base migliore per il task e ha mostrato capacità di trasferimento su una famiglia di task tenuta completamente fuori dal training. Non tutte le run sono andate bene: il repo include i retrospettivi dei tentativi falliti, un livello di trasparenza raro.

L’infrastruttura

L’orchestrazione GPU gestisce l’allocazione delle macchine Runpod, la sottomissione dei job e il ritorno dei risultati. Gli script di training interno (prime-rl) e i materiali di valutazione sono tutti nel repo. Il progetto include anche un sistema di analisi per capire cosa l’agente ha imparato a fare bene e dove fallisce ancora.

Costi e riproducibilità

Circa 1300 dollari per l’intero training dell’agente. Tutto il necessario per replicare l’esperimento è pubblico: codice, config, pesi dell’agente addestrato (su Hugging Face), e persino le note personali dell’autore sui pilot falliti. Un segnale forte che l’infrastruttura per agenti di training si sta spostando dal lab di ricerca allo spazio accessibile a chi ha un budget modesto e voglia di sperimentare.

Implicazioni

Meta-apprendimento con RL a costi accessibili dimostra che il ciclo “AI addestra AI” non è più territorio esclusivo dei grandi lab. La trasparenza del progetto (fallimenti documentati, retrospettivi onesti) offre un esempio di come condividere esperimenti complessi in modo che altri possano imparare davvero, non solo replicare il successo.

Scrivi per cercare fra corso, playbook, skill, paper…