Radar · 15/07/2026 · survenu le 14/07/2026 · recherche

Un agent RL entraîne des modèles avec RL pour 1300 dollars

Un projet open source sur GitHub a entraîné un agent IA (basé sur Qwen3.6-35B avec LoRA) à écrire des configurations d’entraînement complètes pour des modèles plus petits, en utilisant le reinforcement learning dans les deux boucles. L’agent reçoit une description du task (« enseigne à un modèle à résoudre des requêtes multi-hop sur des personnages »), écrit l’environnement, la fonction de reward, le dataset et les hyperparamètres, et lance le job sur GPU Runpod. Le reward de l’agent dépend de la performance du modèle entraîné sur une évaluation cachée.

Le coût total de l’entraînement de l’agent a été d’environ 1300 dollars. Le projet a ouvert tout: les poids de l’agent (adaptateur LoRA sur Hugging Face), le code d’orchestration GPU, les familles de tasks, le code des rewards, et les rapports détaillés de chaque tentative, y compris les échecs. L’agent a progressé d’un reward ~0.0 à un pic de ~0.63 en 54 étapes, et a montré des capacités de transfert sur des tasks jamais vus pendant l’entraînement.

Pourquoi tu devrais t’en soucier: jusqu’à il y a quelques mois, ce type de meta-apprentissage était le territoire des labs de recherche. Maintenant le coût est à la portée de quiconque veut expérimenter sérieusement, et l’infrastructure pour les agents qui entraînent des modèles se démocratise. Le projet démontre que tu peux construire une boucle complète d’entraînement agentic avec des ressources accessibles, et que la transparence sur le processus (y compris les échecs) fait la différence pour ceux qui apprennent.

En détail

Comment ça marche

Deux boucles RL séparées, deux stacks d’entraînement différents. Dans la boucle externe, l’agent trainer (Qwen3.6-35B avec LoRA) est entraîné avec Tinker et le cookbook importance-sampling GRPO. Un épisode consiste à recevoir une spécification de task, travailler dans un workspace via des outils d’édition de fichiers, et soumettre un job complet. Le reward de l’épisode est le score du modèle entraîné sur une évaluation cachée.

Dans la boucle interne, le petit modèle (Qwen3-0.6B ou 1.7B) est entraîné sur le task avec prime-rl (GRPO) sur GPU Runpod, en utilisant la configuration écrite par l’agent: environnement de vérification, rubrique d’évaluation et config TOML.

Ce qu’il a appris

Le reward a augmenté en deux étapes distinctes. L’agent a appris à choisir le meilleur modèle de base pour le task et a montré des capacités de transfert sur une famille de tasks complètement exclue de l’entraînement. Toutes les runs n’ont pas bien fonctionné: le repo inclut les rétrospectives des tentatives échouées, un niveau de transparence rare.

L’infrastructure

L’orchestration GPU gère l’allocation des machines Runpod, la soumission des jobs et le retour des résultats. Les scripts d’entraînement interne (prime-rl) et les matériaux d’évaluation sont tous dans le repo. Le projet inclut aussi un système d’analyse pour comprendre ce que l’agent a appris à bien faire et où il échoue encore.

Coûts et reproductibilité

Environ 1300 dollars pour l’entraînement complet de l’agent. Tout ce qui est nécessaire pour répliquer l’expérience est public: code, config, poids de l’agent entraîné (sur Hugging Face), et même les notes personnelles de l’auteur sur les pilotes échoués. Un signal fort que l’infrastructure pour les agents d’entraînement se déplace du lab de recherche à l’espace accessible à ceux qui ont un budget modeste et l’envie d’expérimenter.

Implications

Le meta-apprentissage avec RL à coûts accessibles démontre que le cycle « l’IA entraîne l’IA » n’est plus le territoire exclusif des grands labs. La transparence du projet (échecs documentés, rétrospectives honnêtes) offre un exemple de comment partager des expériences complexes de façon que les autres puissent vraiment apprendre, pas simplement répliquer le succès.

Tapez pour chercher dans cours, playbooks, skills, papers…