Transparence
Fiabilité - validation mesurée
TrustCheckIA publie ses taux d'erreur, mesurés sur l'application en production. Aide à la décision documentée - pas une preuve infaillible.
Seuil de décision 50/100 · validation interne préliminaire, N = 11
Taux d'erreur selon le seuil
| Seuil | Sensibilité | Spécificité | Exactitude | Faux positifs | Faux négatifs |
|---|---|---|---|---|---|
| 35 | 100 % | 80 % | 91 % | 1 | 0 |
| 50 (recommandé) | 83 % | 100 % | 91 % | 0 | 1 |
Pour un usage en discussion contractuelle, l'erreur grave est le faux positif - accuser à tort un livrable humain. TrustCheckIA retient un seuil conservateur (50) : sur ce corpus, aucun document humain n'a été classé IA. Séparation moyenne des classes : 67 (IA) contre 25 (humain).
Validation de l'apport humain et de la proactivité
L'indice de recours à l'IA n'est qu'une des couches du rapport. Le contre-test du 15/08/2026, mené sur un corpus contrôlé de six documents (trois à faible apport, trois à apport riche documenté), mesure aussi la couche « apport humain » et la couche « proactivité / itérations ».
| Couche | Apport faible (moyenne) | Apport riche (moyenne) | Séparation |
|---|---|---|---|
| Apport humain (0-100) | 26,0 | 59,3 | +33,3 points |
| Proactivité / itérations | 0 | 57 | +57 points |
| Sollicitations plausibles du modèle | 1 | 5 | x5 |
Classification de l'apport humain au seuil 50 : 5 documents sur 6 correctement séparés. Les mesures sont déterministes : deux exécutions du même document rendent les mêmes scores, et les fourchettes de temps plausibles le sont également (durées unitaires fixes). Seule la couche qualitative rédigée par le modèle - commentaires, extraits retenus - peut varier légèrement entre deux exécutions.
Limite assumée sur cette couche : un apport humain riche mais non documenté (aucun journal d'itérations, aucune pièce de processus) reste sous-évalué. La proactivité ne mesure pas l'effort réel, seulement l'effort vérifiable dans les pièces fournies.
Limites (publiées honnêtement)
- Validation préliminaire, N = 11 : intervalle de confiance large.
- Vérité terrain humaine présumée pour les sources web.
- Documents IA testés = sorties LLM non retravaillées ; un document IA volontairement humanisé serait plus difficile (sensibilité réelle plus basse en contexte adverse).
- Corpus francophone, genres professionnels.
- Zone grise 35-50 : documents courts/factuels (IA) ou très tabulaires (humain) - diagnostic « à confirmer », lire l'analyse indicateur par indicateur.