CE QU’IL Y A DERRIÈRE

Comment ça marche

Quatre réponses courtes : pourquoi nous observons le comportement des IA, ce que nous mesurons, comment la mesure est produite, et ce qu’elle ne dit pas.

01 · POURQUOI

Pourquoi observer les IA ?

Les systèmes d’intelligence artificielle sont probabilistes, évolutifs et complexes. Contrairement à un logiciel entièrement figé, ils peuvent produire des réponses différentes dans des situations comparables et changer de comportement dans le temps. Cette variabilité, associée à une industrialisation encore récente, crée un problème concret d’explicabilité, de confiance et de maîtrise du risque.

Depuis quatre mois, l’Observatoire NeoMundi conduit un programme continu d’observation des systèmes d’IA. La Météo des IA™ en est le démonstrateur public : chaque jour, elle rend visibles et comparables les variations comportementales d’un panel de systèmes.

Son message est simple : pour juger et gouverner une IA, il faut d’abord pouvoir la mesurer. Découvrir une dérive après un incident revient à comprendre, une fois sous la pluie, qu’il aurait fallu prendre un parapluie.

NeoMundi apporte la couche de mesure qui manque entre l’IA et les systèmes qui l’utilisent. Pendant l’exécution, elle produit un signal de qualité et de risque traçable. Ce signal permet à une application connectée de diagnostiquer une situation et, selon les règles choisies par l’organisation, de poursuivre, demander une supervision humaine ou interrompre une réponse avant sa livraison.

La Météo des IA™ montre publiquement le principe. L’infrastructure NeoMundi l’applique aux usages réels : mesurer pendant l’exécution plutôt que rechercher l’incident après coup.

En savoir plus : Pourquoi mesurer les IA ?

Quatre niveaux pour orienter l’attention

« Une IA peut se tromper » : cet avertissement concerne aussi bien les particuliers que les entreprises qui déploient ces systèmes. Sans mesure pendant l’exécution, contrôler le risque revient souvent à rechercher après coup une réponse problématique parmi des milliers d’échanges.

Chaque couleur indique une condition comportementale observée. Elle montre où porter son attention, sans décider à la place de l’utilisateur.

Normal

EN: Normal

Le comportement du système reste dans sa plage attendue pour cette observation.

Vigilance

EN: Watch

Une variation a été observée et mérite d’être suivie dans les jours qui viennent.

Alerte

EN: Warning

Un écart plus marqué par rapport au comportement attendu a été mesuré.

Critique

EN: Critical

Une perturbation importante du comportement du système a été observée.

02 · CE QUE NOUS MESURONS

Ce que nous mesurons

Six notions réelles et documentées derrière chaque carte du panel : rien ici n’est un score de performance ou de qualité.

Stabilité

La régularité avec laquelle un système répond lors d’exécutions répétées du même protocole sentinelle.

Variation

L’écart mesurable entre plusieurs réponses obtenues dans des conditions contrôlées et comparables.

Dérive comportementale

Un changement durable du comportement observé sur plusieurs mesures successives, distinct d’une variation ponctuelle.

Observation quotidienne

Chaque système est observé quotidiennement au moyen des mêmes questions sentinelles.

jours consécutifs publiés

Horodatage

Chaque observation porte l’heure réelle de sa capture en UTC, indépendamment de l’heure d’affichage de la page.

dernière mesure (UTC)

Couverture

La proportion des observations attendues qui ont effectivement été exécutées et évaluées. Une couverture incomplète reste explicitement visible.

couverture du panel aujourd’hui

03 · COMMENT LA MESURE EST PRODUITE

Comment la mesure est produite

WEATHER-SENTINEL, le protocole fixe derrière chaque carte du mur.

01

Panel fixe, questions fixes

Le même panel de systèmes reçoit chaque jour les mêmes questions sentinelles, selon des paramètres documentés et dans des conditions aussi comparables que possible.

02

Exécutions répétées

Chaque système fait l’objet de 30 exécutions quotidiennes : une question sentinelle principale est répétée 23 fois et une question complémentaire fixe est répétée 7 fois.

03

Comparaison à la référence

Les observations du jour sont comparées à l’historique récent du système. La stabilité, l’ampleur de la variation, sa persistance et la couverture disponible contribuent à déterminer la condition affichée.

04

Publication vérifiable

Le résultat est enregistré dans une capsule horodatée et chaînée par empreinte cryptographique, puis publié sous forme de données JSON et de widgets réutilisables.

04 · LIMITES

Ce que la mesure ne dit pas

La Météo des IA™ observe et mesure des signaux comportementaux. Elle ne transforme pas la mesure en verdict.

  • Elle ne classe pas les systèmes et ne désigne pas le « meilleur » modèle.
  • Elle ne certifie ni ne garantit leur comportement futur.
  • Elle ne juge pas si une réponse individuelle est vraie ou fausse.
  • Elle ne remplace ni l’audit, ni la conformité, ni la gouvernance, ni le jugement humain.
  • Un niveau observé constitue un signal d’attention, jamais une décision automatique.

NeoMundi apporte le signal. L’utilisateur l’interprète et décide.

Pourquoi ce n’est pas un benchmark

Un benchmark évalue généralement la performance d’un modèle sur un ensemble de tâches à un instant donné.

NeoMundi mesure autre chose : la continuité du comportement d’un système dans le temps et pendant son fonctionnement.

Un modèle peut conserver de bonnes performances moyennes tout en devenant moins stable ou en changeant de régime. C’est cette évolution invisible qu’une mesure longitudinale permet de révéler.

UNE NOUVELLE COUCHE DE MESURE

Mesurer avant de gouverner

La Météo des IA™ est le démonstrateur public d’une idée simple : on ne peut pas gouverner durablement ce que l’on ne mesure pas.

NeoMundi développe la couche de mesure manquante entre les systèmes d’IA et les organisations qui les utilisent. Une primitive indépendante transforme les observations d’exécution en signaux mesurables, traçables et réutilisables.

Cette approche repose sur quatre différences :

  • Mesurer pendant l’exécution, plutôt que découvrir les écarts après un incident.
  • Construire une mémoire longitudinale, afin de rendre visibles les changements de comportement dans le temps.
  • Connecter une seule mesure à plusieurs usages et infrastructures, sans reconstruire le système à chaque intégration.
  • Produire une trace lisible par les machines, indiquant ce qui a été mesuré, quand, dans quel contexte et sous quelle version.

Une infrastructure en construction ouverte

L’Observatoire NeoMundi conduit un programme continu d’observation et de sensibilisation à l’esprit critique fondé sur la mesure.

L’Observatoire est soutenu par Infomaniak. La technologie NeoMundi est accompagnée par NVIDIA Inception et l’OVHcloud Startup Program.

La Météo des IA™ ne demande pas de croire un classement. Elle donne à chacun un point de départ documenté pour observer, comparer, questionner et décider avec davantage de discernement.

Soutiens et programmes

  • Logo d'Infomaniak
  • Logo de NVIDIA Inception
  • Logo d'OVHcloud Startup Program