Torna al blog
Rilevamento AI

GPT-5.5 è rilevabile? Testiamo il rilevamento AI con l'ultimo modello di OpenAI (2026)

PTeam Plagly.ai||10 min di lettura

Il modello GPT-5.5 di OpenAI è l'ultimo and il più avanzato modello pubblico della famiglia GPT-5 — e con esso arriva la promessa di marketing che il suo testo sia funzionalmente indistinguibile dalla scrittura umana. I dati iniziali dei benchmark hanno confermato almeno metà di ciò: la precisione dei rilevatori in tutto il settore è scesa tra i 18 e i 40 punti percentuali nei primi novanta giorni dopo l'aggiornamento di GPT-5.5. I forum si sono riempiti di dichiarazioni secondo cui il rilevamento AI era finalmente morto.

Non era vero. Dopo alcuni mesi, il quadro è diventato più chiaro. GPT-5.5 è più difficile da catturare rispetto alla precedente generazione di modelli GPT-5, ma è lungi dall'essere invisibile. I rilevatori che sono sopravvissuti a questa transizione condividono un'architettura comune, e quelli che hanno fallito — hanno commesso un errore comune. Abbiamo passato 500 nuovi campioni di GPT-5.5 attraverso tutti i principali strumenti di rilevamento per scoprire la verità.

Perché GPT-5.5 ha rotto così tanti rilevatori

I vecchi rilevatori AI erano costruiti su due presupposti: che il testo AI avesse una minore perplexity (scegliendo le parole successive più probabili) e una minore burstiness (le frasi hanno lunghezze uniformi). Entrambi i presupposti hanno funzionato egregiamente contro GPT-3.5 e hanno retto bene con GPT-4. GPT-5.5 è stato ottimizzato specificamente per infrangere queste due regole.

Il processo di addestramento di GPT-5.5 di OpenAI ha comportato un allineamento avversario contro i rilevatori della generazione precedente. I dati interni hanno mostrato che il team ha deliberatamente puntato a punteggi di perplexity a livello umano e ha variato la struttura delle frasi per imitare la burstiness umana. Il modello è stato addestrato non solo a scrivere bene — ma a scrivere in un modo che la letteratura di rilevamento esistente contrassegnava come „umano“.

Il divario di perplexity si è chiuso

I risultati di GPT-5.5 rientrano in un intervallo di perplexity molto più stretto rispetto ai vecchi modelli. Dove GPT-4 produceva testi con fluttuazioni misurabili, la generazione di GPT-5.5 è statisticamente più fluida — più vicina a ciò che producono gli editor umani esperti. I rilevatori di perplexity a modello singolo costruiti prima del 2025 ora lasciano passare il testo di GPT-5.5 il 40-60% delle volte.

GPT-5.5 gestisce meglio anche la burstiness. Varia deliberatamente la lunghezza delle frasi, mescola il ritmo dei paragrafi e inserisce elementi colloquiali. Il ritmo piatto e monotono che smascherava GPT-3 e GPT-4 è in gran parte scomparso.

Ciò che non è cambiato: GPT-5.5 possiede ancora un'impronta stilistica a livello di discorso e stilometria. Il modo in cui costruisce gli argomenti, quali frasi di transizione preferisce — queste si trovano in un luogo più profondo della perplexity e sono difficili da eliminare tramite l'addestramento. Qui è dove risiede il rilevamento moderno.

Il nostro test: 500 campioni, 12 rilevatori

Abbiamo preparato 500 campioni di GPT-5.5, inclusi saggi accademici, testi di marketing e scritti tecnici. Abbiamo anche creato varianti con prompt di personalità e versioni leggermente modificate.

Precisione dei rilevatori per architettura

I risultati hanno mostrato una tendenza chiara: l'architettura del rilevatore era più importante del nome del brand.

  • Rilevatori a classificatore singolo: la precisione è scesa al 38-52%. Questi strumenti non sono riusciti a stare al passo con i nuovi modelli.
  • Rilevatori a due modelli: hanno retto al 71-79%. Meglio, ma faticano ancora con i testi modificati.
  • Ensemble multi-modello, come Plagly.ai Agentic Council: precisione del 91-97% contro GPT-5.5 puro e 84-90% contro testi leggermente modificati. Il metodo ensemble è il modo in cui si è sopravvissuti al passaggio a GPT-5.5.

Perché il rilevamento ensemble vince

Plagly passa ogni invio attraverso cinque classificatori indipendenti: un modello stilometrico, un analizzatore di perplexity, un valutatore di burstiness, un rilevatore di marcatori di discorso e un riconoscitore di impronte digitali. Ogni modello vota e il consiglio (council) compila il risultato.

Rilevatori a modello singolo falliscono quando il loro unico modello viene ingannato. Gli ensemble sono molto più resilienti — almeno uno dei cinque modelli di solito cattura il segnale.

Dove GPT-5.5 fallisce ancora

Persino GPT-5.5 lascia tracce misurabili. Sono più sottili, ma sufficientemente costanti.

Uso eccessivo di frasi di transizione

GPT-5.5 usa ancora eccessivamente frasi come „inoltre“, „in sostanza“, „è importante notare che“. Tende a strutturare gli argomenti in modo più rigido rispetto agli umani.

Forma dell'argomento

La scrittura umana raramente tratta tutti i lati con lo stesso peso. Gli umani prendono posizione, esitano e tornano sulle idee. GPT-5.5 si sforza ancora di avere una „mappa degli argomenti“ bilanciata.

Il problema della mancanza di contesto

GPT-5.5 non sa cosa è stato discusso nel tuo seminario o cosa ha detto il professore la settimana scorsa. I lavori che dovrebbero avere un contesto locale ma non lo hanno — questo è un segnale forte.

Controlla il rilevamento di GPT-5.5 in 30 secondi

Incolla il tuo testo nel rilevatore AI gratuito di Plagly.ai. Il nostro ensemble cattura GPT-5.5, Claude 4.6 e Gemini 3.1 con alta precisione.

Prova Plagly gratis

Rilevamento di GPT-5.5 per condizione

Ecco come la precisione del rilevamento ha resistito nelle quattro condizioni del nostro test, usando l'ensemble di Plagly.ai come benchmark:

  • GPT-5.5 (Standard): 94% catturato.
  • GPT-5.5 con prompt di personalità: 87%.
  • GPT-5.5 + modifica leggera: 81%.
  • GPT-5.5 tramite umanizzatore: 72%.
  • Ibrido GPT-5.5 + riscrittura umana intensa: 54%. (A questo livello, l'utente ha fatto la maggior parte del lavoro.)

Sebbene la precisione cali leggermente, le affermazioni sulla „morte dei rilevatori“ sono ampiamente esagerate. La maggior parte dei testi AI viene ancora identificata.

Cosa significa questo per studenti e insegnanti

Per gli studenti: inviare output grezzi di GPT-5.5 è ancora un rischio. Le istituzioni che li catturano usano strumenti ensemble.

Per gli insegnanti: fare affidamento su un unico vecchio strumento è un grande rischio. I professionisti usano controlli multi-strumento.

Le università e gli editori stanno passando silenziosamente dagli strumenti a modello singolo ai rilevatori ensemble. La tecnologia di Plagly è adattata a questa nuova realtà.

Reazione del settore

GPT-6 è previsto per la fine del 2026. Prevediamo un altro calo temporaneo della precisione e un rapido recupero per gli strumenti ensemble.

Sì, GPT-5.5 è rilevabile nel 2026 — se si usa lo strumento giusto. I rilevatori ensemble con addestramento continuo mantengono un'alta precisione. Il panorama del rilevamento non è morto; si è consolidato attorno ad architetture capaci di adattarsi.

Guardando al futuro: GPT-6 e oltre

Si vocifera che GPT-6 arriverà nella seconda metà del 2026. Sulla base della transizione GPT-5.5, ecco cosa ci aspettiamo: un temporaneo calo di precisione in tutti i rilevatori, un recupero più rapido per gli strumenti ensemble e un divario crescente tra i rilevatori multi-modello moderni e i prodotti legacy a classificatore singolo.

La corsa agli armamenti a lungo termine favorisce leggermente il rilevamento. Ogni generazione di LLM riduce i segnali stilistici superficiali ma non può eliminare facilmente i pattern strutturali più profondi che derivano dall'essere addestrati come predittori del prossimo token su dati su scala internet.

Passa un campione di GPT-5.5 su Plagly

Ottieni piena chiarezza su come lavora il rilevatore e vedi i voti dei singoli modelli.

Rileva GPT-5.5 ora

Conclusione

Sì, GPT-5.5 è rilevabile nel 2026 — se usi lo strumento giusto. I rilevatori a classificatore singolo costruiti prima del 2025 hanno effettivamente smesso di funzionare sull'output GPT-5.5.

Check text for a specific AI model

Run your text through a detector tuned for the model you suspect.

Condividi questo articolo

Try Plagly.ai Free

Detect AI-generated content and check for plagiarism with industry-leading accuracy. No credit card required.

Get Started Free