Iki 2026 m. gegužės mėnesio profesionaliame ir akademiniame rašyme dominuoja trys pagrindiniai DI modeliai: „OpenAI“ GPT-5.5, „Anthropic“ „Claude 4.6“ ir „Google“ „Gemini 3.1“. Kiekvienas jų reklamuojamas teigiant, kad jo rezultatai atrodo neįtikėtinai žmogiški. Ir kiekvienas palieka skirtingą statistinį atspaudą, kurį detektoriai gali — o kartais ir negali — pagauti.
Mes praleidome 600 naujų pavyzdžių per šiuos tris modelius ir kiekvieną jų patikrinome tuo pačiu ansamblio detektoriumi. Rezultatai paneigia kelias įprastas prielaidas apie tai, kurį modelį sunkiausia aptikti — ir paaiškina, kodėl atsakymas 2026 m. yra svarbesnis nei bet kada anksčiau.
Kaip mes testavome
Sugeneravome po 200 rezultatų kiekvienam modeliui — po 50 akademinių rašinių, rinkodaros tekstų, techninių paaiškinimų ir grožinės literatūros sričių. Kiekvienas pavyzdys naudojo numatytąjį raginimą be nurodymų vengti aptikimo. Tada sukūrėme priešpriešinius variantus: humanizuotą versiją ir lengvai redaguotą versiją (15–20 % perrašytų žodžių). Iš viso: 600 bazinių pavyzdžių, 1200 priešpriešinių pavyzdžių.
Kiekvieną pavyzdį vertino „Plagly.ai“ Agentic Council ansamblis (perpleksiškumas, netolygumas, stiliometrija, atspaudas, diskursas) ir gegneproduktas su naujausiu komerciniu vieno modelio detektoriumi. Rezultatai žemiau nurodo „Plagly“ aptikimo dažnį.
Pagrindiniai rezultatai: neapdoroti rezultatai
Numatytuose rezultatuose be papildomo redagavimo visi trys modeliai laikosi stebėtinai arti vienas kito — tačiau maži skirtumai yra atskleidžiantys.
Aptikimo tikslumas ties neapdorotais rezultatais
GPT-5.5 (neapdorotas): 94 % pagauta. „Claude 4.6“ (neapdorotas): 88 % pagauta. „Gemini 3.1“ (neapdorotas): 92 % pagauta. Visi trys yra patikimai aptinkami ansamblio įrankių, tačiau „Claude 4.6“ atotrūkis yra matomas.
Kodėl „Claude 4.6“ pirmauja nematomumo srityje
„Claude 4.6“ buvo mokomas skiriant didelį dėmesį kalbos lygio variacijai ir žmogiškam prozos ritmui. Modelis agresyviau keičia sakinių struktūrą nei konkurentai, naudoja mažiau formulių („be to“, „iš esmės“) ir rodo tikresnį įsipareigojimą pozicijai. Rezultatas — tekstas, kuris perpleksiškumo ir netolygumo ašyse yra arčiausiai žmogaus prozos.
Kodėl GPT-5.5 lengviausia pastebėti
Nors GPT-5.5 yra labiausiai optimizuotas sklandumui, jis išlaiko stipriausius struktūrinius dėsningumus. Mokymas pabrėžė patikimumą ir pusiausvyrą, o tai sukuria atpažįstamą argumento formą: įžanga, kelių perspektyvų pateikimas, apibendrinimas. Detektoriai, modeliuojantys diskurso lygmenį, tai fiksuoja nuosekliai, net kai paviršiniai sakinių bruožai praeina.
Kur modeliai išsiskiria: požymių išskaidymas
Bendri tikslumo skaičiai slepia didesnius skirtumus tame, kurie požymiai sukelia aptikimą. Peržiūrint balus pagal klasifikatorius atsiskleidžia naudingesnė istorija.
Diskurso signalai
GPT-5.5 turi stipriausią diskurso atspaudą. Jo polinkis į subalansuotus argumentus, tam tikrų pereinamųjų frazių perteklius ir tendencija iš anksto apibendrinti leidžia lengviausiai pastebėti jį pastraipų lygmenyje — net kai atskiri sakiniai praeina vieno modelio detektorius.
Stiliometriniai signalai
„Gemini 3.1“ pirmauja pagal stiliometrinius požymius. Jo rezultatai rodo savitus prieveiksnių dažnumo, pasyviosios giminės konstrukcijų ir sakinių ritmo dėsningumus. Šie požymiai giliai įsišakniję „Google“ mokymo duomenyse.
Perpleksiškumo signalai
„Claude 4.6“ turi „švariausią“ perpleksiškumo profilį — jo rezultatai artimiausi žmogaus rašytiems etalonams. Štai kodėl vieno modelio detektoriams jį sunkiausia pagauti. Tačiau „Claude 4.6“ vis tiek turi išmatuojamus atspaudo ir diskurso požymius, todėl ansamblio detektoriai išlaiko tikslumą.
Išbandykite visus tris modelius prieš „Plagly“ ansamblį
Įklijuokite GPT-5.5, „Claude 4.6“ ar „Gemini 3.1“ tekstą į „Plagly.ai“ nemokamą DI detektorių. Pamatykite išskaidymą pagal modelius — perpleksiškumą, netolygumą, stiliometriją, atspaudą, diskursą.
Išbandyti „Plagly“ nemokamaiPriešpriešinės sąlygos: kai tampa sunkiau
Didesnis atotrūkis tarp modelių atsiranda esant priešpriešinėms sąlygoms. Perleidus kiekvieną modelį per humanizatorių, dar kartą patikrinome:
- GPT-5.5 + humanizatorius: 72 % pagauta.
- „Claude 4.6“ + humanizatorius: 64 % pagauta.
- „Gemini 3.1“ + humanizatorius: 70 % pagauta.
„Claude 4.6“ pranašumas dar labiau išauga įsijungus humanizatoriui, tačiau net ir sudėtingiausiu atveju dauguma jo rezultatų vis tiek pažymimi. Mintis, kad kuris nors iš šių modelių gali patikimai išvengti modernių ansamblio detektorių, neatitinka duomenų.
Kodėl tai svarbu 2026 m.
Modelių karai paspartėjo 2025 m. pabaigoje ir 2026 m., „OpenAI“ išleidus GPT-5.5 siekiant aplenkti „Claude“ pranašumą nematomumo srityje, „Anthropic“ atsakius su „Claude 4.6“ ritmo patobulinimais, o „Google“ stumiant „Gemini 3.1“ užpildyti sklandumo spragą.
Vieno modelio detektoriai tampa vis labiau nepatikimi
Ties visais trimis modeliais vieno klasifikatoriaus detektoriai yra labiausiai pažeidžiami. Įrankis, besiremiantis tik perpleksiškumu, kuris gerai veikė ties GPT-3.5, dabar „Claude 4.6“ tekstą klaidingai priskiria žmogui 50–60 % atvejų. Ansambliai išlaiko tikslumą, nes joks vienas modelis neturi atlikti viso darbo.
Nuolatinis pakartotinis mokymas svarbiau už bet kurį algoritmą
„Plagly.ai“ Agentic Council nuolat persimoko pagal naujus pagrindinių modelių rezultatus. „Claude 4.6“ aptikimo tikslumas pakilo maždaug šešiais procentiniais punktais nuo pat pasirodymo, nes jo stiliaus dėsningumai buvo geriau atvaizduoti mokymo duomenyse.
Kas toliau: „Claude 5“, GPT-6, „Gemini 4“
Visos trys laboratorijos viešai užsiminė apie kitos kartos leidimus 2026–2027 m. Tikimės: dar vieno laikino nuosmukio visuose įrankiuose pasirodžius naujiems modeliams, greitesnio ansamblio produktų atsigavimo ir didėjančio atotrūkio nuo vieno modelio įrankių.
Ilgalaikės varžybos šiek tiek palankesnės aptikimui. Kiekviena LLM karta sumažina paviršinius požymius, bet negali lengvai pašalinti gilesnių struktūrinių dėsningumų, atsirandančių dėl to, kad modeliai mokomi kaip kito žetono numatymo įrankiai.
Atlikite realų modelių palyginimą
Turite GPT-5.5, „Claude 4.6“ ar „Gemini 3.1“ tekstų? Nemokamas „Plagly“ detektorius išskaido, kokius signalus kiekvienas modelis sukelia — ir parodo, kodėl tas pats turinys kitaip atrodo ansambliui.
Atlikti nemokamą testąEsmė
„Claude 4.6“ šiuo metu yra sunkiausiai aptinkamas iš trijų pagrindinių modelių — bet tik keliais procentais ir tik lyginant su vieno modelio detektoriais. Kelių modelių ansambliai vis tiek pažymi daugumą visų trijų modelių rezultatų. Teisingas klausimas 2026-iesiems yra ne „kurį modelį galiu naudoti, kad išvengčiau aptikimo?“, o „kuriuo detektoriumi galiu pasitikėti?“. Atsakymas niekada nebuvo aiškesnis.
