Aller au contenu principal
Recherche · Paper ·

PROOF-Gen : des données optimisées pour une meilleure distillation

PROOF-Gen est le nom d'une nouvelle méthode présentée pour améliorer la distillation des capacités d'utilisation d'outils dans des modèles d'intelligence artificielle destinés à la production. La pratique standard actuelle consiste à affiner par apprentissage supervisé des modèles sur des trajectoires générées par un modèle enseignant plus puissant, un processus rejoué quotidiennement ou chaque semaine dans les chaînes de post entraînement des agents capables d'appeler des outils. Ce cycle suit une logique de génération puis filtrage: seules les trajectoires réussies du modèle enseignant sont conservées, les échecs étant simplement jetés. Sur le benchmark τ2 bench, 57% des essais du modèle enseignant échouent, et deux tiers de ces échecs sont qualifiés de quasi réussites, la plupart des appels d'outils étant corrects mais la tâche finale n'aboutissant pas.

1 min de lecturePertinence 46
Source

Résumé et traduction réalisés par Le Fil IA à partir de Apple Machine Learning. Lire l'article original →

Cette situation pose un problème économique et technique majeur pour l'industrie de l'intelligence artificielle. Faire appel à un modèle enseignant de pointe a un coût significatif à chaque cycle d'entraînement, et le fait de jeter systématiquement les trajectoires imparfaites prive les équipes d'un signal d'apprentissage précieux. Les scénarios les plus difficiles, ceux où le modèle échoue de justesse, restent ainsi non résolus cycle après cycle, ce qui freine les progrès des agents conversationnels et des assistants capables d'interagir avec des interfaces de programmation externes.

Ce constat s'inscrit dans un effort plus large de recherche visant à rendre l'entraînement des agents d'intelligence artificielle plus efficace et moins coûteux, à mesure que l'appel d'outils devient une fonctionnalité centrale des déploiements commerciaux. En cherchant à exploiter les échecs quasi réussis plutôt qu'à les écarter, cette approche ouvre la voie à des méthodes de distillation qui tirent davantage de valeur de chaque appel au modèle enseignant, réduisant potentiellement les coûts récurrents des pipelines de post entraînement.

Impact France / UEChamp produit par Le Fil IA

Pas d'impact direct sur la France/UE

À lire ensuite

01ProText : un jeu de données de référence pour mesurer les erreurs de genre dans les textes longs38Apple Machine LearningRecherche 02Metis d'Alibaba réduit les appels d'outils IA redondants de 98 % à 2 %, avec une meilleure précision45VentureBeat AIRecherche 03« IA sans environnement : génération de données synthétiques pour agents d'appel API »34Apple Machine LearningRecherche 

Le brief du matin

L'essentiel de l'IA chaque jour. Gratuit, désinscription en un clic.

Recevez l'essentiel de l'IA chaque jour

Gratuit · 1 email le matin, l'essentiel de l'IA · désinscription en un clic

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.