Comment le score est construit
La plupart des produits de notation renvoient un chiffre, sans explication. Voici exactement ce qui arrive à une réponse que vous soumettez — et ce que nous faisons quand nous ne sommes pas sûrs.
| # | Couche | Rôle |
|---|---|---|
| 1 | Vérifications déterministes | Nombre de mots, contrôles de structure et déclencheurs du zéro automatique. Aucune IA n'intervient. |
| 2 | Mesure | Transcription, mesure acoustique de la prononciation et de la fluidité, vérification déterministe de la grammaire et des accords. |
| 3 | Dossier de preuves | Chaque mesure est réunie dans un dossier structuré, transmis aux correcteurs comme preuve et non comme consigne. |
| 4 | Deux correcteurs indépendants | Deux modèles distincts notent selon les critères officiels. Aucun des deux ne voit la note de l'autre. |
| 5 | Désaccord | Un niveau d'écart : nous combinons. Deux : l'intervalle s'élargit et nous le disons. Trois ou plus : aucun chiffre n'est affiché avant l'arbitrage d'un troisième correcteur, et une révision humaine gratuite vous est offerte. |
| 6 | Calibrage | Les notes sont corrigées par une courbe ajustée sur de vraies copies corrigées, avec une correction par groupe de langue maternelle lorsque les données le permettent. |
| 7 | L'intervalle | Le résultat est un intervalle assorti d'une garantie de couverture, et non une valeur unique. |
Nous ne présentons jamais la moyenne de deux notes très différentes comme un résultat établi. C'est la façon la plus courante dont un produit de notation induit quelqu'un en erreur.
Ce qui produit réellement le chiffre
Aucun examinateur humain ne lit votre travail ici. Chaque note de ce produit est produite par un logiciel, et la façon honnête de le dire est de préciser quelle partie fait quoi.
En service aujourd'hui
| Tâche | Comment elle est effectuée |
|---|---|
| Transformer votre enregistrement en texte | Reconnaissance automatique de la parole |
| Prononciation, accentuation, fluidité et hésitations | Notation acoustique au niveau du phonème — son par son, et non phrase par phrase |
| Grammaire, orthographe et accords | Vérification déterministe par règles. Aucun modèle n'intervient : cette couche ne peut pas se tromper avec assurance |
| Appliquer les critères publiés de l'examen à votre production écrite et orale | Un modèle de langue, à qui les mesures déterministes ci-dessus sont fournies comme preuves et non comme consignes |
Les sous-traitants qui effectuent ce travail sont nommés, avec ce que chacun reçoit et pourquoi, sur la page des données et des sous-traitants dans l'application. Cette page-là suit l'évolution de la chaîne technique; celle-ci décrit volontairement la fonction plutôt que le fournisseur, afin de ne pas devenir périmée en silence.
En construction
- Deux modèles de langue indépendants notent chaque réponse séparément. Aucun des deux ne voit la note de l'autre. Aujourd'hui, un seul modèle effectue la notation : le second correcteur et l'arbitrage ci-dessous constituent la partie en construction.
- Quand l'écart est d'un niveau, les deux notes sont combinées et l'intervalle se resserre.
- Quand l'écart est de deux niveaux, l'intervalle s'élargit et le produit le dit, au lieu de présenter une moyenne comme un résultat établi.
- Quand l'écart atteint trois niveaux ou plus, aucun chiffre n'est affiché avant l'arbitrage d'un troisième modèle — et une révision humaine gratuite est offerte.
- Calibrage et intervalle de confiance. Les notes brutes sont corrigées par une courbe ajustée sur de vraies copies corrigées, puis converties en un intervalle assorti d'une garantie de couverture.
Ce que le marché publie, et ce qu'il ne publie pas :
France Éducation international, via TV5MONDE, met gratuitement à disposition plus de 600 questions d'entraînement au TCF, avec un simulateur hors ligne. Des plateformes commerciales existent, et plusieurs corrigent automatiquement la production écrite. Aucune ne publie de mesure de sa précision — ni corpus, ni protocole de correction, ni statistique d'accord. Le marché se compare sur les résultats annoncés de ses candidats. Nous entendons nous comparer sur une erreur mesurée et publiée :
Nous mesurerons l'erreur de ce système face à de vrais relevés de notes officiels et nous la publierons — y compris lorsque le résultat ne nous avantage pas.
Écrit au futur, volontairement. Cela suppose un ensemble de calibrage constitué de vrais relevés de notes, qui n'existe pas encore, et la première publication aura lieu à la fin de la phase française. L'affirmer au présent aujourd'hui serait exactement le type d'allégation de précision non méritée que ce produit veut remplacer.
Ce que nous promettons, et ce que nous ne promettons pas
Nous ne prétendons pas prédire votre résultat officiel. Nous n'écrivons jamais « garanti », ni « exact à 100 % » — personne ne peut l'être honnêtement, et un produit qui l'affirme vous renseigne surtout sur lui-même.
En construction Ce que nous publierons à la fin de la phase française : notre erreur absolue moyenne mesurée contre de vrais relevés de notes officiels, le taux d'accord entre nos notes et celles de correcteurs humains, et la fréquence réelle à laquelle notre intervalle annoncé à 90 % contenait le résultat. Ainsi qu'un audit d'équité par langue maternelle, y compris les groupes où nos résultats sont moins bons.
Si nous n'atteignons pas nos propres seuils de précision, nous ne publierons aucune prédiction chiffrée. Le produit se limitera alors à une rétroaction qualitative. Cette règle est inscrite dans notre plan de développement comme une condition de publication, non comme une intention.
Une limite, dite clairement
La garantie de couverture de l'intervalle tient lorsque les personnes ayant servi au calibrage ressemblent aux personnes qui utilisent le produit. Notre groupe de calibrage est recruté : la correspondance est proche, mais pas parfaite. Nous réestimons la couverture sur des résultats réels chaque trimestre, et nous la publierons lorsqu'elle bougera.