Do maja 2026 roku trzy czołowe modele AI dominują w profesjonalnym i akademickim piśmie: GPT-5.5 od OpenAI, Claude 4.6 od Anthropic oraz Gemini 3.1 od Google. Każdy z nich trafia na rynek z obietnicami marketingowymi dotyczącymi tego, jak bardzo ludzkie wydają się jego wyniki. Każdy z nich jest używany miliony razy dziennie do tworzenia tekstów, które ostatecznie trafiają do esejów, raportów i bibliotek treści. I każdy z nich pozostawia inny statystyczny ślad, który narzędzia do wykrywania mogą — lub czasami nie mogą — wychwycić.
Przeanalizowaliśmy 600 nowych próbek ze wszystkich trzech modeli i przepuściliśmy każdą przez ten sam wielomodelowy detektor zintegrowany. Wyniki obalają kilka powszechnych założeń na temat tego, który model jest najtrudniejszy do wykrycia — i wyjaśniają, dlaczego ta odpowiedź ma większe znaczenie w 2026 roku niż w jakimkolwiek wcześniejszym roku.
Jak testowaliśmy
Wygenerowaliśmy po 200 tekstów na model — po 50 z esejów akademickich, tekstów marketingowych, objaśnień technicznych i fikcji literackiej. Każde generowanie wykorzystywało domyślny monit systemowy bez instrukcji mających na celu uniknięcie wykrycia. Następnie stworzyliśmy warianty testowe dla każdego z nich: wersję przetworzoną przez humanizer oraz wersję lekko edytowaną (15–20% słów przepisywanych ręcznie). Łącznie: 600 próbek bazowych, 1200 próbek zmodyfikowanych.
Każda próbka została oceniona przez system Agentic Council w Plagly.ai (perplexity, burstiness, stylometria, fingerprint, dyskurs) i zweryfikowana z najnowszym klasyfikatorem z wiodącego komercyjnego detektora jednomodelowego. Poniższe wyniki przedstawiają wskaźnik wykrywalności Plagly.
Główne wyniki: Surowe dane wyjściowe
W przypadku domyślnych wyników bez edycji modyfikującej, trzy modele plasują się zaskakująco blisko siebie — jednak małe różnice są znaczące.
Dokładność wykrywania surowych danych wyjściowych
GPT-5.5 (surowy): 94% wykrytych. Claude 4.6 (surowy): 88% wykrytych. Gemini 3.1 (surowy): 92% wykrytych. Przy domyślnych wynikach bez monitów omijających zabezpieczenia, wszystkie trzy modele są niezawodnie wykrywane przez narzędzia wielomodelowe — ale różnica między Claude 4.6 a pozostałymi jest faktem.
Dlaczego Claude 4.6 prowadzi w ukrywaniu się
Claude 4.6 został przeszkolony ze szczególnym naciskiem na zróżnicowanie rejestru językowego i zbliżony do ludzkiego rytm prozy. Model zmienia strukturę zdań bardziej agresywnie niż konkurenci, używa mniej szablonowych przejść i wykazuje większe autentyczne zaangażowanie w stanowisko w tekstach argumentacyjnych. Rezultatem jest tekst, który plasuje się bliżej prozy ludzkiej na osiach perplexity i burstiness, które podkreślają detektory jednomodelowe.
Dlaczego GPT-5.5 jest najłatwiejszy do zauważenia
Pomimo bycia najbardziej zoptymalizowanym pod kątem płynności, GPT-5.5 zachowuje najsilniejsze odgórne wzorce strukturalne z całej trójki. Jego szkolenie kładło nacisk na niezawodność i równowagę, co generuje rozpoznawalny kształt argumentu: wprowadzenie, przedstawienie wielu perspektyw, zakończenie wyważoną syntezą. Detektory modelujące dyskurs na poziomie akapitów i dokumentów wyłapują to konsekwentnie, nawet gdy cechy powierzchniowe na poziomie zdań przechodzą testy.
Gdzie modele się różnią: podział na poszczególne cechy
Ogólne liczby dotyczące dokładności skrywają większe różnice w tym, które cechy wyzwalają wykrywanie. Spojrzenie na wyniki poszczególnych klasyfikatorów mówi nam więcej.
Sygnały dyskursu
GPT-5.5 ma najsilniejszy ślad dyskursu z całej trójki. Jego preferencja dla zrównoważonych argumentów, nadmierne używanie niektórych fraz przejściowych i tendencja do wstępnego podsumowywania sprawiają, że jest najłatwiejszym do wykrycia z trzech wiodących modeli na poziomie akapitu — nawet gdy pojedyncze zdania przechodzą przez jednomodelowe detektory.
Sygnały stylometryczne
Gemini 3.1 przoduje pod względem sygnałów stylometrycznych. Jego dane wyjściowe wykazują charakterystyczne wzorce w częstotliwości używania przysłówków, konstrukcji strony biernej oraz rytmu na poziomie zdań składowych. Cechy te są głęboko zakorzenione w sposobie selekcji danych treningowych Google i okazały się trudne do wyeliminowania przez model bez utraty płynności.
Sygnały perplexity
Claude 4.6 ma najczystszy profil perplexity — jego wyniki leżą najbliżej ludzkich punktów odniesienia. To właśnie sprawia, że jest najtrudniejszy do wykrycia dla jednomodelowych detektorów perplexity. Claude 4.6 wciąż jednak posiada mierzalne cechy śladu cyfrowego i dyskursu, dlatego detektory wielomodelowe zachowują na nim wysoką dokładność tam, gdzie prostsze narzędzia zawodzą.
Przetestuj wszystkie trzy modele w zestawieniu z systemem Plagly
Wklej tekst wygenerowany przez GPT-5.5, Claude 4.6 lub Gemini 3.1 do darmowego detektora AI Plagly.ai. Zobacz podział na poszczególne parametry — perplexity, burstiness, stylometria, fingerprint, dyskurs — oraz dowiedz się, który sygnał wpłynął na wynik.
Wypróbuj Plagly za darmoWarunki omijania zabezpieczeń (Adversarial): Kiedy robi się trudniej
Większa różnica między modelami pojawia się w warunkach omijania zabezpieczeń. Po przepuszczeniu danych wyjściowych każdego modelu przez humanizer, przeprowadziliśmy ponowny test:
- GPT-5.5 + humanizer: 72% wykrytych.
- Claude 4.6 + humanizer: 64% wykrytych.
- Gemini 3.1 + humanizer: 70% wykrytych.
Przewaga Claude 4.6 w warunkach surowych rośnie jeszcze bardziej, gdy w grę wchodzi humanizer — ale nawet przy najbardziej niesprzyjających ustawieniach większość wyników Claude 4.6 jest nadal flagowana. Przekonanie, że którykolwiek z tych modeli może niezawodnie omijać nowoczesne detektory wielomodelowe, nie znajduje potwierdzenia w danych.
Dlaczego ma to znaczenie w 2026 roku
Wojny modeli przyspieszyły pod koniec 2025 i w 2026 roku: OpenAI wydało GPT-5.5, próbując prześcignąć Claude w kwestii niewykrywalności, Anthropic odpowiedział poprawkami rytmu prozy w Claude 4.6, a Google wdrożył Gemini 3.1, aby zmniejszyć dystans w płynności językowej. Z punktu widzenia wykrywania, konsekwencje praktyczne stają się spójne.
Detektory jednomodelowe są coraz bardziej zawodne
W przypadku wszystkich trzech modeli detektory z jednym klasyfikatorem są najbardziej narażone na błędy. Narzędzie oparte wyłącznie na perplexity, które dobrze radziło sobie z GPT-3.5, teraz błędnie klasyfikuje wyniki Claude 4.6 w 50–60% przypadków. Narzędzie oparte wyłącznie na burstiness zawodzi podobnie. Wielomodelowe systemy zintegrowane zachowują dokładność, ponieważ żaden pojedynczy model nie musi wykonywać całej pracy.
Ciągłe douczanie modeli ma większe znaczenie niż pojedynczy algorytm
Plagly.ai's Agentic Council stale doucza swój moduł śladu cyfrowego (fingerprint) na świeżych wynikach z każdego głównego czołowego modelu. Dokładność wykrywania Claude 4.6 wzrosła o około sześć punktów procentowych od momentu uruchomienia, w miarę jak wzorce stylistyczne modelu stawały się lepiej reprezentowane w danych treningowych — to schemat, który powtarza się przy każdym nowym wydaniu modeli.
Co dalej: Claude 5, GPT-6, Gemini 4
Wszystkie trzy laboratoria publicznie zapowiedziały wydania kolejnej generacji na rok 2026 i 2027. Opierając się na cyklu GPT-5.5/Claude 4.6/Gemini 3.1, oto czego możemy się spodziewać: kolejnego przejściowego spadku dokładności wykrywania we wszystkich narzędziach przy każdym dużym wydaniu, szybszego powrotu do normy dla produktów wielomodelowych oraz dalszego pogłębiania się przepaści między nowoczesnymi detektorami wielomodelowymi a przestarzałymi produktami z jednym klasyfikatorem.
Długoterminowy wyścig zbrojeń nieznacznie sprzyja wykrywaniu. Każda generacja LLM redukuje powierzchowne cechy stylistyczne, ale nie może łatwo wyeliminować głębszych wzorców strukturalnych, które wynikają z faktu szkolenia modelu jako predyktora kolejnego tokenu na danych o skali Internetu. Te wzorce są tym, czego uczą się dobrze zaprojektowane detektory, i to jest warstwa, która przetrwa aktualizacje modeli.
Uruchom prawdziwe starcie modeli
Posiadasz teksty z GPT-5.5, Claude 4.6 lub Gemini 3.1? Darmowy detektor Plagly analizuje, które sygnały uruchamia każdy model — i pokazuje, dlaczego ta sama treść jest inaczej interpretowana przez narzędzia wielomodelowe w porównaniu do jednomodelowych.
Uruchom darmowy test wykrywaniaPodsumowanie
Claude 4.6 jest obecnie najtrudniejszym do wykrycia z trzech czołowych modeli — ale tylko o kilka punktów procentowych i tylko w odniesieniu do detektorów jednomodelowych. Systemy wielomodelowe wciąż flagują większość wyników wszystkich trzech modeli, a różnica ta zmniejsza się wraz z każdą rundą ponownego szkolenia detektorów. Właściwe pytanie na rok 2026 brzmi nie “którego modelu mogę użyć, aby uniknąć wykrycia?”, lecz “któremu detektorowi mogę zaufać, aby dał mi dokładny odczyt?”. Odpowiedź na to pytanie — system zintegrowany, wielomodelowy, stale aktualizowany — nigdy nie była bardziej oczywista.
