RechercheOpenAI Blog20sem

Évaluation de la surveillance de la chaîne de pensée

Résumé IASource uniqueImpact UE

OpenAI a introduit un nouveau cadre et un ensemble d'évaluations pour la monitorabilité de la chaîne de pensée, couvrant 13 évaluations sur 24 environnements. Ses résultats montrent que surveiller le raisonnement interne d'un modèle est bien plus efficace que de surveiller uniquement les sorties, ouvrant ainsi la voie à un contrôle à grande échelle des systèmes d'IA devenant plus capables.

Dans nos dossiers

OpenAI

Vu une erreur factuelle dans cet article ? Signalez-la. Toutes les corrections valides sont publiées sur /corrections.

À lire aussi

1OpenAI Blog

Les modèles de raisonnement luttent pour contrôler leurs chaînes de pensée, et c'est bien ainsi

OpenAI a introduit CoT-Control et a constaté que les modèles de raisonnement ont du mal à contrôler leurs chaînes de pensée, ce qui souligne l'importance de la surveillabilité comme mesure de sécurité en IA. Cette difficulté à réguler leurs processus de raisonnement renforce l'idée que la capacité à surveiller les pensées des modèles est cruciale pour assurer leur sécurité.

RechercheOpinion

1 source

2Apple Machine Learning

Entraînés sur des tokens, calibrés sur des concepts : l'émergence de la calibration sémantique dans les LLMs

Les grands modèles de langage (LLM) sont capables d'évaluer leur propre confiance au niveau sémantique, pas seulement au niveau des tokens — et ce sans avoir été explicitement entraînés pour cela. Une étude montre que les LLM de base sont remarquablement bien calibrés pour estimer leur certitude sur le sens réel de leurs réponses dans des tâches de questions-réponses en domaine ouvert. Les chercheurs proposent un mécanisme théorique expliquant pourquoi cette calibration sémantique émerge naturellement de l'entraînement sur des tokens.

RecherchePaper

1 source

3Apple Machine Learning

De la localisation à la fonction : évaluation de l'intelligence spatiale et fonctionnelle des LLM multimodaux

Des chercheurs ont publié SFI-Bench (Spatial-Functional Intelligence Benchmark), un nouveau cadre d'évaluation conçu pour tester une forme plus avancée d'intelligence spatiale chez les grands modèles de langage multimodaux. Le benchmark comprend plus de 1 700 questions tirées de vidéos égocentrées d'intérieurs domestiques filmées sous différents angles, couvrant des environnements variés du quotidien. Contrairement aux benchmarks existants comme VSI-Bench, SFI-Bench ne se contente pas de demander aux modèles où se trouvent les objets, mais cherche à évaluer s'ils comprennent à quoi ces objets servent dans leur contexte réel. Cette distinction est fondamentale pour le développement d'agents IA capables d'agir dans le monde physique. Un robot ou un assistant visuel qui sait qu'une tasse est posée sur la table, mais ne comprend pas qu'elle sert à boire, sera incapable de planifier des actions cohérentes dans un environnement domestique. SFI-Bench cible précisément ce niveau cognitif supérieur, appelé intelligence fonctionnelle, qui conditionne l'autonomie réelle des agents multimodaux dans des tâches de robotique domestique, d'assistance aux personnes ou de navigation intelligente. La course aux benchmarks spatiaux s'est accélérée ces deux dernières années, à mesure que les modèles comme GPT-4o, Gemini et les LLM open-source progressaient en perception visuelle. Les évaluations géométriques de base ne suffisent plus à différencier les systèmes les plus capables. SFI-Bench s'inscrit dans un effort plus large de la communauté pour définir des critères d'évaluation alignés sur des usages concrets, et pourrait devenir une référence incontournable pour mesurer la maturité des agents embarqués ou des assistants visuels de prochaine génération.

RecherchePaper

1 source

4HuggingFace Blog

Le Standard d'Évaluation Ouverte : Évaluation de NVIDIA Nemotron 3 Nano avec NeMo Evaluator

Le Standard d'Évaluation Ouverte : Comparaison de NVIDIA Nemotron 3 Nano avec NeMo Evaluator Ce texte présente l'utilisation du NeMo Evaluator pour tester les performances du NVIDIA Nemotron 3 Nano, un modèle de processeur AI, en se basant sur le Standard d'Évaluation Ouverte. Les résultats mettent en évidence des améliorations significatives en termes de vitesse et d'efficacité énergétique par rapport aux versions précédentes.

UELe NeMo Evaluator a évalué le NVIDIA Nemotron 3 Nano, un processeur AI, selon le Standard d'Évaluation Ouverte, révélant des améliorations notables en vitesse et en efficacité énergétique, bénéfique pour les entreprises européennes comme NVIDIA, et aligné avec les objectifs de l'AI Act sur l'efficacité énergétique, tout en respectant le RGPD dans la gestion des données.

RechercheOutil

1 source

Recevez l'essentiel de l'IA chaque jour

Une sélection éditoriale quotidienne, sans bruit. Directement dans votre boîte mail.

Recevez l'essentiel de l'IA chaque jour