PROOF-Gen : des données optimisées pour une meilleure distillation
PROOF-Gen est le nom d'une nouvelle méthode présentée pour améliorer la distillation des capacités d'utilisation d'outils dans des modèles d'intelligence artificielle destinés à la production. La pratique standard actuelle consiste à affiner par apprentissage supervisé des modèles sur des trajectoires générées par un modèle enseignant plus puissant, un processus rejoué quotidiennement ou chaque semaine dans les chaînes de post entraînement des agents capables d'appeler des outils. Ce cycle suit une logique de génération puis filtrage: seules les trajectoires réussies du modèle enseignant sont conservées, les échecs étant simplement jetés. Sur le benchmark τ2 bench, 57% des essais du modèle enseignant échouent, et deux tiers de ces échecs sont qualifiés de quasi réussites, la plupart des appels d'outils étant corrects mais la tâche finale n'aboutissant pas.
Résumé et traduction réalisés par Le Fil IA à partir de Apple Machine Learning. Lire l'article original →
Cette situation pose un problème économique et technique majeur pour l'industrie de l'intelligence artificielle. Faire appel à un modèle enseignant de pointe a un coût significatif à chaque cycle d'entraînement, et le fait de jeter systématiquement les trajectoires imparfaites prive les équipes d'un signal d'apprentissage précieux. Les scénarios les plus difficiles, ceux où le modèle échoue de justesse, restent ainsi non résolus cycle après cycle, ce qui freine les progrès des agents conversationnels et des assistants capables d'interagir avec des interfaces de programmation externes.
Ce constat s'inscrit dans un effort plus large de recherche visant à rendre l'entraînement des agents d'intelligence artificielle plus efficace et moins coûteux, à mesure que l'appel d'outils devient une fonctionnalité centrale des déploiements commerciaux. En cherchant à exploiter les échecs quasi réussis plutôt qu'à les écarter, cette approche ouvre la voie à des méthodes de distillation qui tirent davantage de valeur de chaque appel au modèle enseignant, réduisant potentiellement les coûts récurrents des pipelines de post entraînement.
Pas d'impact direct sur la France/UE