Toukokuussa 2026 markkinoita hallitsee kolme AI-mallia: GPT-5.5, Claude 4.6 ja Gemini 3.1. Jokainen lupaa „inhimillistä“ tekstiä, ja jokainen jättää uniikin tilastollisen jäljen.
Testisime 600 näytettä selvittääksemme, mikä malli on vaikein napata.
Kuinka testasimme
Raakatuloksissa mallit ovat lähekkäin: GPT-5.5 (94 % napattu), Claude 4.6 (88 % napattu), Gemini 3.1 (92 % napattu). Claude 4.6 on edelleen hieman „näkymättömämpi“.
Se vaihtelee paremmin lauserakennetta ja rytmiä. Sen teksti on perplexity- ja burstiness-mittareilla lähimpänä ihmisen kirjoitusta.
Keskeiset tulokset
Sujuvuudesta huolimatta se säilyttää vahvat rakenteelliset kaavat ja argumentointimuodot, jotka tunnistimet huomaavat diskurssitasolla.
Raakatulosteiden tunnistustarkkuus
GPT-5.5:llä on vahva diskurssijälki, Gemini 3.1 loistaa stiliometrisillä ominaisuuksilla ja Claude 4.6:lla on „puhtain“ perplexity-profiili.
Miksi Claude 4.6 on vaikeampi havaita
Yhden mallin tunnistimet muuttuvat epäluotettaviksi (esim. ne erehtyvät 50–60 % tapauksista Claude 4.6:n kanssa). Ansamblitunnistimet, kuten Plagly, säilyttävät tarkkuuden.
Miksi GPT-5.5 on helpompi huomata
Claude 4.6 on tällä hetkellä vaikein tunnistaa, mutta vain muutamalla prosentilla. Ansamblit voittavat silti. Tärkeintä on luottaa työkaluun, jota päivitetään jatkuvasti.
Signaalien analyysi
Otsikon tarkkuusluvut kätkevät suurempia eroja mitkä ominaisuudet laukaisevat tunnistuksen. Luokittelijakohtaisten tulosten tarkastelu kertoo hyödyllisemmän tarinan.
Keskustelusignaalit
GPT-5.5:llä on vahvin keskustelun sormenjälki näistä kolmesta. Sen mieltymys tasapainoisiin argumentteihin, tiettyjen siirtymälauseiden liiallinen käyttö ja taipumus tehdä yhteenveto etukäteen tekevät siitä helpoimman kolmesta rajamallista havaita kappaletasolla – vaikka yksittäiset lauseet ohittavat yhden mallin ilmaisimet.
Stylometriset signaalit
Gemini 3.1 johtaa stylometric kertoo. Sen lähdöt osoittavat erottuvia malleja adverbitaajuudessa, passiivisessa äänirakenteessa ja lausetason rytmissä. Nämä ominaisuudet liittyvät syvästi siihen, miten Googlen harjoitustiedot on kuratoitu, ja mallin on osoittautunut vaikeaksi tukahduttaa ne menettämättä sujuvuutta.
Hämmennyssignaalit
Claude 4.6:lla on puhtain hämmennysprofiili – sen tulokset ovat lähimpänä ihmisen kirjoittamia lähtökohtia. Tämä tekee yhden mallin hämmennysilmaisimien havaitsemisesta vaikeinta. Mutta Claude 4.6:ssa on edelleen mitattavissa olevia sormenjälki- ja keskusteluominaisuuksia, minkä vuoksi ensemble-ilmaisimet säilyttävät sen tarkkuuden silloin, kun yksinkertaisemmat työkalut epäonnistuvat.
Testaa malleja Plaglya vastaan
Liitä teksti ja katso yksittäisten signaalien analyysi.
Tarkista PlaglyllaVastuulliset olosuhteet: Kun asiat vaikeutuvat
Suurempi ero mallien välillä näkyy vastakkaisissa olosuhteissa. Kun jokaisen mallin tulos oli suoritettu humanisaattorin läpi, testasimme uudelleen:
- GPT-5.5 + humanisaattori: 72 % kiinni.
- Claude 4.6 + humanisaattori: 64 % kiinni.
- Gemini 3.1 + humanisaattori: 70 % kiinni.
Claude 4.6:n johto raa'issa olosuhteissa levenee entisestään, kun humanisoija tulee kuvaan – mutta jopa kaikkein vastustavimmassa ympäristössä suurin osa Claude 4.6:n lähdöstä on silti merkitty. Ajatus siitä, että mikä tahansa näistä malleista voi luotettavasti välttää nykyaikaiset ryhmäilmaisimet, ei kestä tietoja.
Miksi tämä on tärkeää vuonna 2026
Mallisodat kiihtyivät vuosien 2025 ja 2026 loppuun asti, kun OpenAI toimitti GPT-5.5:n, jotta Clauden varkain etu oli poikki, Anthropic vastasi Claude 4.6:n proosarytmiparannuksilla ja Google painoi Gemini 3.1:tä sulkeakseen sujuvuusvajeen. Havaitsemisen kannalta käytännön vaikutukset ovat lähentymässä.
Yhden mallin ilmaisimet ovat yhä epäluotettavia
Kaikkien kolmen mallin kohdalla yhden luokittelijan ilmaisimet ovat kaikkein haavoittuvimpia. Pelkkään perplexityyn (lausehämmennykseen) perustuva työkalu, joka toimi hyvin GPT-3.5:n kanssa, luokittelee nyt Claude 4.6:n tuotoksen väärin 50–60 % tapauksista. Pelkkään burstinessiin (vaihtelevuuteen) perustuva työkalu epäonnistuu samalla tavalla. Monimalliset ansamblit säilyttävät tarkkuuden, koska mikään yksittäinen malli ei tee yksin kaikkea työtä.
Jatkuva uudelleenkoulutus merkitsee enemmän kuin mikään yksittäinen algoritmi
Plagly.ai:n Agenttineuvosto (Agentic Council) uudelleenkouluttaa sormenjälkimoduuliaan jatkuvasti kunkin suuren rajapintamallin uusilla tuloksilla. Tunnistustarkkuus Claude 4.6:n kohdalla on noussut noin kuusi prosenttiyksikköä julkaisun jälkeen, kun mallin stilistiset piirteet tulivat paremmin edustetuiksi harjoitusdatassa — kaava, joka toistuu jokaisen uuden mallijulkaisun myötä.
Mitä seuraavaksi: Claude 5, GPT-6, Gemini 4
Kaikki kolme kehityslaboratoriota ovat julkisesti ilmoittaneet seuraavan sukupolven julkaisuista vuoden 2026 aikana ja vuodelle 2027. GPT-5.5/Claude 4.6/Gemini 3.1 -syklin perusteella on odotettavissa: väliaikainen tunnistustarkkuuden notkahdus kaikissa työkaluissa jokaisen suuren julkaisun yhteydessä, nopeampi toipuminen ansamblituotteille ja jatkuvasti kasvava kuilu nykyaikaisten monimallisten tunnistimien ja perinteisten yhden luokittelijan tuotteiden välillä.
Pidempiaikainen varustelukilpailu suosii tunnistusta — hieman. Jokainen LLM-sukupolvi vähentää pinnallisia stilistisiä piirteitä, mutta ei voi helposti eliminoida syvempiä rakenteellisia malleja, jotka syntyvät siitä, että malli on koulutettu ennustamaan seuraavaa merkkiä (next-token predictor) internetin laajuisella datalla. Nämä mallit ovat juuri niitä, joita hyvin suunnitellut ilmaisimet oppivat lukemaan, ja se on se taso, joka selviää mallipäivityksistä.
Järjestä mallien välinen vertailu
Onko sinulla GPT-5.5-, Claude 4.6- tai Gemini 3.1 -mallien tuotoksia? Plaglyn ilmainen tunnistin näyttää, mitkä signaalit kukin malli laukaisee — ja osoittaa, miksi sama sisältö näyttää erilaiselta ansamblityökaluille kuin yksittäisille luokittelijoille.
Suorita ilmainen tunnistustestiYhteenveto
Claude 4.6 on tällä hetkellä vaikein tunnistaa kolmesta rajapintamallista — mutta vain muutamalla prosenttiyksiköllä ja vain silloin, kun sitä mitataan yhden mallin ilmaisimia vastaan. Monimalliset ansamblit havaitsevat edelleen suurimman osan kaikkien kolmen mallin tuotoksista, ja kuilu kapenee entisestään jokaisella tunnistimen uudelleenkoulutuskierroksella. Oikea kysymys vuodelle 2026 ei ole „mitä mallia voin käyttää tunnistuksen välttämiseksi?“, vaan „mihin tunnistimeen voin luottaa saadakseni tarkan arvion?“. Vastaus tähän kysymykseen — ansambli, monimallinen, jatkuvasti uudelleenkoulutettu — ei ole koskaan ollut selkeämpi.
