Atpakaļ uz emuāru
DI ziņas

GPT-5.5 pret Claude 4.6 pret Gemini 3.1: kuru 2026. gada DI ir visgrūtāk noteikt?

PPlagly.ai komanda||9 min lasīšana

Līdz 2026. gada maijam profesionālajā un akadēmiskajā rakstniecībā dominē trīs vadošie DI modeļi: OpenAI GPT-5.5, Anthropic Claude 4.6 un Google Gemini 3.1. Katrs no tiem nāk ar mārketinga apgalvojumiem par to, cik cilvēciski jūtas to radītie rezultāti. Katrs tiek izmantots miljoniem reižu dienā tāda veida rakstīšanai, kas nonāk esejās, ziņojumos un satura bibliotēkās. Un katrs atstāj atšķirīgu statistisko nospiedumu, ko noteikšanas rīki var — vai dažreiz nevar — uztvert.

Mēs palaidām 600 jaunus paraugus visos trīs modeļos un katru no tiem izvadījām caur vienu un to pašu daudzmodeļu ansambļa detektoru. Rezultāti apgāž dažus izplatītus pieņēmumus par to, kuru modeli ir visgrūtāk noteikt, un izskaidro, kāpēc atbilde 2026. gadā ir svarīgāka nekā jebkurā iepriekšējā gadā.

Kā mēs testējām

Mēs ģenerējām 200 rezultātus katram modelim — pa 50 no katra akadēmiskajām esejām, mārketinga tekstiem, tehniskajiem skaidrojumiem un radošajai fantastikai. Katrā ģenerēšanā tika izmantota noklusējuma sistēmas uzvedne bez norādījumiem izvairīties no noteikšanas. Pēc tam mēs izveidojām pretpasākumu variantus katram: ar humanizētāju apstrādātu versiju un viegli rediģētu versiju (15–20% vārdu manuāli pārrakstīti). Kopā: 600 bāzes līnijas paraugi, 1200 pretpasākumu paraugi.

Katru paraugu novērtēja Plagly.ai Agentic Council ansamblis (perpleksitāte, mainīgums, stiliometrija, nospiedums, diskurss) un salīdzināja ar jaunāko klasifikatoru no liela komerciāla viena modeļa detektora. Zemāk redzamie rezultāti atspoguļo Plagly noteikšanas līmeni.

Galvenie rezultāti: neapstrādāts izvads

Noklusējuma rezultātos bez pretpasākumu rediģēšanas visi trīs modeļi grupējas pārsteidzoši tuvu viens otram — taču nelielās atšķirības ir atklājošas.

Noteikšanas precizitāte neapstrādātiem rezultātiem

GPT-5.5 (neapstrādāts): 94% noķerti. Claude 4.6 (neapstrādāts): 88% noķerti. Gemini 3.1 (neapstrādāts): 92% noķerti. Noklusējuma rezultātos bez pretpasākumu uzvednēm visus trīs uzticami nosaka ansambļa rīki, taču plaisa starp Claude 4.6 un pārējiem ir reāla.

Kāpēc Claude 4.6 ir līderis slepenības ziņā

Claude 4.6 tika apmācīts, īpašu uzmanību pievēršot reģistra variācijām un cilvēkam līdzīgam prozas ritmam. Modelis agresīvāk variē teikumu struktūru nekā tā konkurenti, izmanto mazāk šablonisku pāreju un izrāda patiesāku apņēmību ieņemt nostāju argumentētā rakstīšanā. Rezultāts ir teksts, kura rādītāji ir tuvāki cilvēka prozai perpleksitātes un mainīguma (burstiness) asīs, kuras izceļ viena modeļa detektori.

Kāpēc GPT-5.5 ir visvieglāk pamanāms

Neskatoties uz to, ka GPT-5.5 ir visvairāk optimizēts plūstamībai, tas saglabā spēcīgākos no augšas uz leju vērstos strukturālos modeļus no visiem trim. Tā apmācībā tika uzsvērta uzticamība un līdzsvars, kas rada atpazīstamu argumenta formu: iepazīstināt, prezentēt vairākas perspektīvas, secināt ar pārdomātu sintēzi. Detektori, kas modelē rindkopu un dokumentu līmeņa diskursu, to konsekventi uztver pat tad, ja teikuma līmeņa virsmas pazīmes iziet cauri.

Kur modeļi atšķiras: pazīmju sadalījums

Galvenie precizitātes skaitļi slēpj lielākas atšķirības tajā, kuras pazīmes izraisa noteikšanu. Skatoties uz katra klasifikatora rezultātiem, atklājas noderīgāks stāsts.

Diskursa signāli

GPT-5.5 ir visspēcīgākais diskursa nospiedums no visiem trim. Tā priekšroka līdzsvarotiem argumentiem, noteiktu pārejas frāžu pārmērīga izmantošana un tendence veikt iepriekšēju kopsavilkumu padara to par visvieglāk pamanāmo no trim vadošajiem modeļiem rindkopas līmenī — pat tad, ja atsevišķi teikumi iziet cauri viena modeļa detektoriem.

Stiliometriskie signāli

Gemini 3.1 ir līderis stiliometriskajās pazīmēs. Tā rezultāti uzrāda atšķirīgus modeļus apstākļa vārdu biežumā, pasīvās izteiksmes konstrukcijās un teikuma daļu līmeņa ritmā. Šīs pazīmes ir dziļi iebūvētas tajā, kā tika atlasīti Google apmācības dati, un modelim ir izrādījies grūti tās apspiest, nezaudējot plūstamību.

Perpleksitātes signāli

Claude 4.6 ir vistīrākais perpleksitātes profils — tā rezultāti atrodas vistuvāk cilvēka rakstītajiem bāzes līmeņiem. Tas padara to par visgrūtāk uztveramo viena modeļa perpleksitātes detektoriem. Bet Claude 4.6 joprojām ir izmērāmas nospiedumu un diskursa pazīmes, tāpēc ansambļa detektori saglabā precizitāti pret to, kur vienkāršāki rīki cieš neveiksmi.

Testējiet visus trīs modeļus pret Plagly ansambli

Ielīmējiet GPT-5.5, Claude 4.6 vai Gemini 3.1 rezultātu Plagly.ai bezmaksas DI detektorā. Skatiet sadalījumu pa modeļiem — perpleksitāte, mainīgums, stiliometrija, nospiedums, diskurss — un to, kurš signāls izraisīja rezultātu.

Izmēģināt Plagly bez maksas

Pretpasākumu apstākļi: kad viss kļūst grūtāk

Lielāka atšķirība starp modeļiem parādās pretpasākumu apstākļos. Pēc katra modeļa rezultātu izvadīšanas caur humanizētāju mēs veicām atkārtotu testēšanu:

  • GPT-5.5 + humanizētājs: 72% noķerti.
  • Claude 4.6 + humanizētājs: 64% noķerti.
  • Gemini 3.1 + humanizētājs: 70% noķerti.

Claude 4.6 pārsvars neapstrādātos apstākļos paplašinās vēl vairāk, kad parādās humanizētājs, taču pat visnelabvēlīgākajā iestatījumā lielākā daļa Claude 4.6 rezultātu joprojām tiek atzīmēti. Pieņēmums, ka jebkurš no šiem modeļiem var uzticami izvairīties no mūsdienu ansambļa detektoriem, neatbilst datiem.

Kāpēc tas ir svarīgi 2026. gadā

Modeļu kari paātrinājās 2025. gada nogalē un 2026. gadā, OpenAI izlaižot GPT-5.5, lai mēģinātu apsteigt Claude slepenības priekšrocības, Anthropic atbildot ar Claude 4.6 prozas ritma uzlabojumiem, un Google virzot Gemini 3.1, lai aizvērtu plūstamības plaisu. No noteikšanas viedokļa praktiskā ietekme konverģē.

Viena modeļa detektori kļūst arvien neuzticamāki

Visos trīs modeļos viena klasifikatora detektori ir visvairāk apdraudēti. Tikai perpleksitātes rīks, kas labi darbojās ar GPT-3.5, tagad nepareizi kategorizē Claude 4.6 rezultātu 50–60% gadījumu. Tikai mainīguma rīks cieš līdzīgu neveiksmi. Daudzmodeļu ansambļi saglabā precizitāti, jo nevienam atsevišķam modelim nav jāveic viss darbs.

Nepārtraukta atkārtota apmācība ir svarīgāka par jebkuru atsevišķu algoritmu

Plagly.ai Agentic Council pastāvīgi apmāca savu nospiedumu moduli ar jauniem rezultātiem no katra lielā vadošā modeļa. Noteikšanas precizitāte Claude 4.6 kopš palaišanas ir pieaugusi par aptuveni sešiem procentpunktiem, jo modeļa stilistiskie raksti kļuva labāk pārstāvēti apmācības datos — modelis, kas atkārtojas ar katru jaunu modeļa izlaidumu.

Kas tālāk: Claude 5, GPT-6, Gemini 4

Visas trīs laboratorijas ir publiski paziņojušas par nākamās paaudzes izlaidumiem līdz 2026. gadam un 2027. gadā. Balstoties uz GPT-5.5/Claude 4.6/Gemini 3.1 ciklu, lūk, kas sagaidāms: kārtējais īslaicīgais noteikšanas precizitātes kritums visos rīkos pie katra lielā izlaiduma, ātrāka atkopšanās ansambļa produktiem un pastāvīga plaisas palielināšanās starp mūsdienu daudzmodeļu detektoriem un mantotajiem viena klasifikatora produktiem.

Ilgtermiņa bruņošanās sacensības dod priekšroku noteikšanai — nedaudz. Katra LLM paaudze samazina seklās stilistiskās pazīmes, taču nevar viegli novērst dziļākos strukturālos modeļus, kas rodas, tiekot apmācītiem kā nākamā marķiera (token) prognozētājiem internetā izplatītos datos. Šie modeļi ir tie, kurus labi izstrādāti detektori iemācās lasīt, un tas ir slānis, kas pārdzīvo modeļu atjauninājumus.

Palaidiet reālu modeļu pretstāvi

Vai jums ir GPT-5.5, Claude 4.6 vai Gemini 3.1 rezultāti? Plagly bezmaksas detektors sadala, kurus signālus katrs modelis iedarbina — un parāda, kāpēc tas pats saturs lasās atšķirīgi ansambļa vs viena modeļa rīkiem.

Palaist bezmaksas noteikšanas testu

Gala rezultāts

Claude 4.6 pašlaik ir visgrūtāk nosakāmais no trim vadošajiem modeļiem — taču tikai par dažiem procentpunktiem un tikai tad, ja to mēra pret viena modeļa detektoriem. Daudzmodeļu ansambļi joprojām atzīmē lielāko daļu no visu trīs modeļu rezultātiem, un plaisa vēl vairāk samazinās ar katru detektoru atkārtotas apmācības kārtu. Pareizais jautājums 2026. gadam ir nevis “kuru modeli es varu izmantot, lai izvairītos no noteikšanas?”, bet gan “kuram detektoram es varu uzticēties, lai iegūtu precīzu rādījumu?” Atbilde uz šo jautājumu — ansamblis, daudzmodeļu, pastāvīgi atkārtoti apmācīts — nekad nav bijusi skaidrāka.

Pārbaudiet tekstu konkrētam MI modelim

Palaidiet savu tekstu caur detektoru, kas pielāgots modelim, par kuru jums ir aizdomas.

Dalīties ar šo rakstu

Izmēģiniet Plagly.ai bez maksas

Nosakiet MI ģenerētu saturu un pārbaudiet plagiātu ar nozares vadošo precizitāti. Kredītkarte nav nepieciešama.

Get Started Free