En mai 2026, trois modèles d'IA de pointe dominent la rédaction professionnelle et académique : GPT-5.5 d'OpenAI, Claude 4.6 d'Anthropic et Gemini 3.1 de Google. Chacun s'accompagne d'arguments marketing affirmant que ses résultats sont d'un naturel humain. Chacun est utilisé des millions de fois par jour pour le type d'écriture qui finit dans des essais, des rapports et des bibliothèques de contenu. Et chacun laisse une empreinte statistique différente que les outils de détection peuvent — ou parfois ne peuvent pas — capturer.
Nous avons testé 600 nouveaux échantillons sur les trois modèles et les avons passés dans le même détecteur d'ensemble multi-modèles. Les résultats bousculent quelques idées reçues sur le modèle le plus difficile à détecter — et clarifient pourquoi la réponse compte plus en 2026 que n'importe quelle année précédente.
Notre protocole de test
Nous avons généré 200 sorties par modèle — 50 de chaque type : essais académiques, textes marketing, explications techniques et fiction créative. Chaque génération a utilisé un prompt système par défaut sans instruction d'évasion de détection. Nous avons ensuite créé des variantes adverses pour chacune : une version traitée par humanisateur et une version légèrement éditée (15–20 % des mots réécrits manuellement). Total : 600 échantillons de base, 1 200 échantillons adverses.
Chaque échantillon a été évalué par l'ensemble du Conseil des Agents de Plagly.ai (perplexité, ráfaga/burstiness, stylométrie, empreinte digitale, discours) et croisé avec le dernier classificateur d'un grand détecteur commercial à modèle unique. Les résultats ci-dessous indiquent le taux de détection de Plagly.
Résultats principaux : Sortie brute
Sur les sorties par défaut sans édition adverse, les trois modèles se regroupent de manière surprenante — mais les petites différences sont révélatrices.
Précision de détection sur les sorties brutes
GPT-5.5 (brut) : 94 % capturés. Claude 4.6 (brut) : 88 % capturés. Gemini 3.1 (brut) : 92 % capturés. Sur les sorties par défaut sans prompts adverses, les trois sont détectés de manière fiable par les outils d'ensemble — mais l'écart entre Claude 4.6 et les autres est réel.
Pourquoi Claude 4.6 mène sur la discrétion
Claude 4.6 a été entraîné avec un accent mis sur la variation du registre et un rythme de prose d'aspect humain. Le modèle varie la structure des phrases de manière plus agressive que ses pairs, utilise moins de transitions conventionnelles et montre un engagement plus authentique dans l'écriture argumentative. Le résultat est un texte dont le score est plus proche de la prose humaine sur les axes de perplexité et de ráfaga (burstiness) que privilégient les détecteurs à modèle unique.
Pourquoi GPT-5.5 est le plus facile à repérer
Bien qu'il soit le plus optimisé pour la fluidité, GPT-5.5 conserve les schémas structurels descendants les plus forts des trois. Son entraînement a mis l'accent sur la fiabilité et l'équilibre, ce qui produit une forme d'argumentation reconnaissable : introduction, présentation de multiples perspectives, conclusion avec une synthèse mesurée. Les détecteurs qui modélisent le discours au niveau du paragraphe et du document repèrent cela systématiquement, même lorsque les caractéristiques de surface au niveau de la phrase passent.
Où les modèles divergent : Analyse par caractéristique
Les chiffres de précision globale cachent des différences plus importantes dans quelles caractéristiques déclenchent la détection. L'examen des scores par classificateur raconte une histoire plus utile.
Signaux de discours
GPT-5.5 a l'empreinte de discours la plus forte des trois. Sa préférence pour les arguments équilibrés, sa surutilisation de certaines phrases de transition et sa tendance à pré-résumer en font le plus facile des trois modèles de pointe à repérer au niveau du paragraphe — même quand des phrases individuelles passent les détecteurs à modèle unique.
Signaux stylométriques
Gemini 3.1 mène sur les indices stylométriques. Ses sorties montrent des motifs distinctifs dans la fréquence des adverbes, la construction de la voix passive et le rythme au niveau de la proposition. Ces caractéristiques sont profondément ancrées dans la manière dont les données d'entraînement de Google ont été curatées et se sont révélées difficiles à supprimer pour le modèle sans perte de fluidité.
Signaux de perplexité
Claude 4.6 a le profil de perplexité le plus propre — ses sorties sont les plus proches des références écrites par des humains. C'est ce qui le rend le plus difficile à capturer pour les détecteurs de perplexité à modèle unique. Mais Claude 4.6 possède toujours des caractéristiques d'empreinte digitale et de discours mesurables, c'est pourquoi les détecteurs d'ensemble maintiennent leur précision là où les outils plus simples échouent.
Testez les trois modèles contre l'ensemble de Plagly
Collez une sortie de GPT-5.5, Claude 4.6 ou Gemini 3.1 dans le détecteur d'IA gratuit de Plagly.ai. Obtenez l'analyse par modèle — perplexité, ráfaga, stylométrie, empreinte digitale, discours — et voyez quel signal a déclenché le score.
Essayer Plagly gratuitementConditions adverses : quand les choses se corsent
L'écart le plus important entre les modèles apparaît dans des conditions adverses. Après avoir passé la sortie de chaque modèle dans un humanisateur, nous avons retesté :
- GPT-5.5 + humanisateur : 72 % capturés.
- Claude 4.6 + humanisateur : 64 % capturés.
- Gemini 3.1 + humanisateur : 70 % capturés.
L'avance de Claude 4.6 dans des conditions brutes s'accentue encore une fois qu'un humanisateur entre en jeu — mais même dans le cadre le plus adverse, la majorité des sorties de Claude 4.6 sont toujours signalées. L'idée que l'un de ces modèles puisse échapper de manière fiable aux détecteurs d'ensemble modernes n'est pas confirmée par les données.
Pourquoi c'est important en 2026
La guerre des modèles s'est accélérée fin 2025 et en 2026, OpenAI sortant GPT-5.5 pour tenter de dépasser l'avantage de discrétion de Claude, Anthropic répondant avec les améliorations de rythme de prose de Claude 4.6, et Google poussant Gemini 3.1 pour combler l'écart de fluidité. Du point de vue de la détection, les implications pratiques convergent.
Les détecteurs à modèle unique sont de moins en moins fiables
Sur les trois modèles, les détecteurs à classificateur unique sont les plus exposés. Un outil basé uniquement sur la perplexité qui fonctionnait bien sur GPT-3.5 classe désormais mal les sorties de Claude 4.6 50–60 % du temps. Un outil basé uniquement sur la ráfaga (burstiness) échoue de la même manière. Les ensembles multi-modèles maintiennent leur précision car aucun modèle n'a besoin de faire tout le travail seul.
Le réentraînement continu compte plus que n'importe quel algorithme
Le Conseil des Agents de Plagly.ai réentraîne son module d'empreinte digitale en continu sur les nouvelles sorties de chaque grand modèle de pointe. La précision de détection sur Claude 4.6 a grimpé d'environ six points de pourcentage depuis le lancement, à mesure que les motifs stylistiques du modèle sont devenus mieux représentés dans les données d'entraînement — un schéma qui se répète à chaque nouvelle sortie de modèle.
Et après : Claude 5, GPT-6, Gemini 4
Les trois laboratoires ont annoncé publiquement des sorties de nouvelle génération pour la fin 2026 et 2027. En se basant sur le cycle GPT-5.5/Claude 4.6/Gemini 3.1, voici à quoi s'attendre : une autre baisse temporaire de précision de détection pour tous les outils à chaque sortie majeure, une récupération plus rapide pour les produits d'ensemble, et un fossé grandissant entre les détecteurs multi-modèles modernes et les produits hérités à classificateur unique.
La course aux armements à long terme favorise légèrement la détection. Chaque génération de LLM réduit les indices stylistiques superficiels mais ne peut pas facilement éliminer les motifs structurels plus profonds issus de l'entraînement en tant que prédicteur du mot suivant sur des données à l'échelle d'Internet. Ces motifs sont ce que les détecteurs bien conçus apprennent à lire, et c'est la couche qui survit aux mises à jour des modèles.
Lancez un duel de modèles en conditions réelles
Vous avez des sorties de GPT-5.5, Claude 4.6 ou Gemini 3.1 ? Le détecteur gratuit de Plagly analyse les signaux déclenchés par chaque modèle — et vous montre pourquoi le même contenu est lu différemment par les outils d'ensemble vs les outils à modèle unique.
Lancer un test de détection gratuitL'essentiel
Claude 4.6 est actuellement le plus difficile à détecter des trois modèles de pointe — mais seulement de quelques points de pourcentage, et uniquement par rapport aux détecteurs à modèle unique. Les ensembles multi-modèles signalent toujours la majorité des sorties des trois modèles, et l'écart se réduit à chaque cycle de réentraînement des détecteurs. La bonne question pour 2026 n'est pas “quel modèle puis-je utiliser pour échapper à la détection ?” mais “à quel détecteur puis-je faire confiance pour obtenir une lecture précise ?” La réponse à cette question — ensemble, multi-modèles, réentraîné en continu — n'a jamais été aussi claire.
