Transparence

Fiabilité - validation mesurée

TrustCheckIA publie ses taux d'erreur, mesurés sur l'application en production. Aide à la décision documentée - pas une preuve infaillible.

91 %
Exactitude
100 %
Spécificité (aucun humain classé IA à tort)
0 faux positif
83 %
Sensibilité (documents IA détectés)

Seuil de décision 50/100 · validation interne préliminaire, N = 11

Taux d'erreur selon le seuil

SeuilSensibilitéSpécificitéExactitudeFaux positifsFaux négatifs
35100 %80 %91 %10
50 (recommandé)83 %100 %91 %01

Pour un usage en discussion contractuelle, l'erreur grave est le faux positif - accuser à tort un livrable humain. TrustCheckIA retient un seuil conservateur (50) : sur ce corpus, aucun document humain n'a été classé IA. Séparation moyenne des classes : 67 (IA) contre 25 (humain).

Validation de l'apport humain et de la proactivité

L'indice de recours à l'IA n'est qu'une des couches du rapport. Le contre-test du 15/08/2026, mené sur un corpus contrôlé de six documents (trois à faible apport, trois à apport riche documenté), mesure aussi la couche « apport humain » et la couche « proactivité / itérations ».

Résultats mesurés par couche sur le corpus contrôlé du 15/08/2026
CoucheApport faible (moyenne)Apport riche (moyenne)Séparation
Apport humain (0-100)26,059,3+33,3 points
Proactivité / itérations057+57 points
Sollicitations plausibles du modèle15x5

Classification de l'apport humain au seuil 50 : 5 documents sur 6 correctement séparés. Les mesures sont déterministes : deux exécutions du même document rendent les mêmes scores, et les fourchettes de temps plausibles le sont également (durées unitaires fixes). Seule la couche qualitative rédigée par le modèle - commentaires, extraits retenus - peut varier légèrement entre deux exécutions.

Limite assumée sur cette couche : un apport humain riche mais non documenté (aucun journal d'itérations, aucune pièce de processus) reste sous-évalué. La proactivité ne mesure pas l'effort réel, seulement l'effort vérifiable dans les pièces fournies.

Limites (publiées honnêtement)

  • Validation préliminaire, N = 11 : intervalle de confiance large.
  • Vérité terrain humaine présumée pour les sources web.
  • Documents IA testés = sorties LLM non retravaillées ; un document IA volontairement humanisé serait plus difficile (sensibilité réelle plus basse en contexte adverse).
  • Corpus francophone, genres professionnels.
  • Zone grise 35-50 : documents courts/factuels (IA) ou très tabulaires (humain) - diagnostic « à confirmer », lire l'analyse indicateur par indicateur.