NIST TEVV-Athlon : ce que le nouveau cadre d'évaluation change pour les projets IA
NIST sollicite des commentaires sur AI 200-2, un projet de cadre TEVV-Athlon pour concevoir des évaluations adaptées aux objectifs et aux risques d'un système IA.
Réponse en bref
Le projet NIST AI 200-2 introduit TEVV-Athlon, une méthode pour construire une évaluation adaptée à un système IA, plutôt qu'un nouveau classement universel. Le cadre part d'un objectif organisationnel, choisit des événements et des outils de test, produit des blocs de mesure, puis relie les preuves à une décision. Pour une entreprise, le changement important est de documenter pourquoi une mesure existe, dans quel contexte elle est recueillie et quelle décision elle peut soutenir.
NIST a annoncé le projet le 7 août 2026 et ouvre une consultation jusqu'au 6 octobre 2026. AI 200-2 est donc un projet soumis à commentaires, pas une norme obligatoire ni une preuve de conformité. Le texte vise des modèles statistiques, des grands modèles de langage, des systèmes multimodaux et des systèmes agentiques (annonce NIST TEVV-Athlon, projet AI 200-2).
Schéma Nexxom : une évaluation relie un objectif, des événements et outils, des blocs de mesure, puis une décision. Le schéma ne représente pas un résultat de test.
Ce qui change par rapport à un classement public
Un classement public répond généralement à une question limitée : comment un modèle se comporte-t-il sur un jeu de tâches donné, avec une méthode et une période données ? Cette information peut aider à filtrer des candidats, mais elle ne décrit pas automatiquement votre langue métier, vos droits, vos données, vos délais, votre interface ou votre coût d'erreur.
TEVV signifie test, évaluation, vérification et validation. Le projet NIST définit cette famille de pratiques comme une manière de produire des preuves qu'un système atteint des objectifs individuels ou organisationnels tout en limitant les impacts négatifs. TEVV-Athlon n'impose donc pas un score unique. Il propose une architecture pour composer une évaluation selon l'objectif et le contexte (NIST AI Risk Management Framework).
Le profil NIST pour l'IA générative et le Playbook AI RMF fournissent déjà des repères de gestion des risques. TEVV-Athlon se place à l'endroit où l'équipe doit transformer ces repères en preuves observables.
Les quatre idées du projet
La page NIST décrit une méthode en quatre étapes pour développer une évaluation personnalisée. Le document complet doit être lu pour les définitions et les exemples, mais les principes opérationnels sont déjà utiles.
| Étape | Question à documenter | Livrable attendu |
|---|---|---|
| Objectif | Quel résultat l'organisation veut-elle atteindre ? | Objectif mesurable et périmètre |
| Événements et outils | Quelles situations et quels instruments produisent les observations ? | Scénarios, jeux de données, scripts ou guides humains |
| Blocs de mesure | Quelles dimensions sont mesurées et comment ? | Indicateurs, critères, traces et règles de calcul |
| Décision | Quelle action suit le résultat ? | Acceptation, reprise, changement ou arrêt |
Le point clé est la traçabilité entre les quatre niveaux. Une métrique de précision peut être correcte et pourtant inutile si elle ne correspond à aucune décision. À l'inverse, une mesure qualitative peut être pertinente si elle capture une erreur grave que le score moyen masque.
Événements, outils et blocs de mesure
NIST décrit un TEVV-Athlon comme une évaluation où les systèmes sont testés à travers des Events et des Tools qui produisent des données sur des Blocks liés à des concepts de mesure. Ces termes sont propres au projet ; ils ne doivent pas être présentés comme une certification.
Un événement peut être une requête utilisateur, un document difficile, une panne d'outil, un changement de modèle ou une interaction longue. Un outil peut être un jeu de données aveugle, un script, une grille de revue humaine, un simulateur ou un instrument de télémétrie. Un bloc rassemble les observations qui permettent d'étudier une dimension comme la fidélité, la latence, la sécurité, la couverture ou la robustesse.
| Objet | Exemple pour un assistant documentaire | Risque si l'objet est mal défini |
|---|---|---|
| Événement | Question avec une politique interne mise à jour | Jeu de test trop simple ou obsolète |
| Outil | Corpus versionné et protocole de notation | Résultat impossible à reproduire |
| Bloc de mesure | Citation correcte, absence de donnée inventée | Score agrégé qui cache une erreur critique |
| Décision | Publier, demander une revue ou bloquer | Mesure sans conséquence opérationnelle |
Les équipes doivent conserver la version du modèle, du prompt, du corpus, du code d'évaluation et du contexte système. Un résultat ne peut être comparé dans le temps que si ces variables sont identifiées.
Une lecture pour les entreprises
TEVV-Athlon ne demande pas de remplacer tous les tests existants. Il aide à les relier. Un test de régression, une revue humaine et une alerte de production peuvent devenir des composants d'une même évaluation, si leur objectif et leur méthode sont documentés.
Pour un achat de modèle, le cadre invite à écrire les critères avant de regarder un score public. Pour un agent, il invite à mesurer la réussite de la tâche, la qualité des appels d'outils, les refus, les escalades et les effets de bord. Pour un système multimodal, il pousse à distinguer les erreurs de perception, de raisonnement et d'action.

Matrice Plotly statique produite par Nexxom. Les valeurs de 1 à 3 sont une heuristique éditoriale sur le contexte, la traçabilité et l'adaptabilité, pas une mesure NIST.
Ce qu'il faut préparer maintenant
Une organisation peut commencer avant la version finale du document :
- Nommer la décision : quel résultat autorise la mise en production, la reprise ou l'arrêt ?
- Définir le contexte : utilisateurs, langues, données, canaux, outils, volumes et contraintes de délai.
- Séparer les erreurs : qualité de réponse, fidélité aux sources, sécurité, équité, disponibilité, coût et action indue.
- Associer une preuve à chaque erreur : exemple, trace, revue, test automatisé ou mesure en production.
- Versionner le protocole : modèle, prompt, corpus, configuration, code et date.
- Définir les seuils et les suites : accepter, corriger, escalader, désactiver ou réévaluer.
Cette discipline complète l'article Nexxom sur l'évaluation d'un LLM au-delà des classements publics et celui sur les traces d'un agent en production. Elle ne transforme pas automatiquement une évaluation interne en preuve réglementaire.
TEVV-Athlon et AITE : deux initiatives à ne pas confondre
NIST présente aussi AITE, un programme d'évaluation avec un environnement de test séquestré et des données aveugles. La page AITE indique que la période d'évaluation d'août 2026 commence avec des tâches d'analyse d'images appliquées à la science quantique, la génomique et la sécurité publique (NIST AITE).
AITE est un programme de test et un environnement de comparaison sur des tâches définies. TEVV-Athlon est un cadre pour concevoir des évaluations adaptées à différents systèmes et objectifs. Une entreprise peut s'inspirer des deux, mais ne doit pas attribuer à AITE les concepts du projet AI 200-2, ni présenter TEVV-Athlon comme un banc d'essai déjà certifié.
| Initiative | Nature | Utilité pour une entreprise |
|---|---|---|
| TEVV-Athlon | Projet de cadre méthodologique | Concevoir une évaluation contextualisée et traçable |
| AITE | Programme et testbed NIST | Observer un programme d'évaluation sur des tâches annoncées |
| Classement public | Résultat comparatif d'un protocole donné | Filtrer des options avant un test interne |
| Test de production | Mesure dans le système réel | Surveiller la dérive, les incidents et les effets métier |
Limites et précautions
Le projet est encore soumis à commentaires. Ses termes, son périmètre et ses exemples peuvent évoluer. NIST invite notamment les parties prenantes à commenter les définitions de test, évaluation, vérification et validation, la flexibilité du cadre, les activités insuffisamment couvertes et son utilité pour les systèmes émergents (questions de consultation NIST).
Ne promettez donc pas qu'une évaluation « alignée TEVV-Athlon » prouve une conformité. Ne publiez pas un score sans le corpus, les versions, la méthode et les limites. Ne remplacez pas un contrôle humain ou une validation de sécurité par un score agrégé.
Les équipes peuvent aussi comparer leur protocole au projet NIST sur les standards IA et documenter les écarts. Le cadre NIST reste volontaire ; les obligations applicables dépendent du secteur, du pays, du contrat et de l'usage.
Conclusion
TEVV-Athlon apporte une idée pratique : une évaluation utile commence par une décision, pas par un classement. Les entreprises peuvent déjà cartographier leurs objectifs, événements, outils, blocs de mesure et suites opérationnelles, puis conserver les preuves dans un registre versionné. Le projet AI 200-2 mérite une veille et, pour les organisations concernées, une lecture attentive avant la fin de la consultation le 6 octobre 2026.
Pour approfondir, comparez cette méthode à vos tests de raisonnement des LLM et à votre dispositif de sorties structurées. L'objectif n'est pas d'ajouter une étiquette à vos tests, mais de rendre chaque décision d'IA défendable par une preuve compréhensible.
Sources primaires vérifiées le 24 août 2026
- NIST, annonce TEVV-Athlon et consultation AI 200-2
- NIST AI 200-2, projet de document
- NIST, AI Risk Management Framework
- NIST, Generative AI Profile
- NIST, AI RMF Playbook
- NIST, AI Technology Evaluation
- NIST, AI Standards
- NIST, programme ITL AI
- NIST, recherche IA

