Když společnost DeepSeek počátkem roku 2025 vydala jako open-source svůj vlajkový uvažující model DeepSeek-R1, zásadním způsobem proměnila oblast umělé inteligence. Zatímco standardní autoregresní modely LLM (jako GPT-4o nebo Claude 3.5 Sonnet) předpovídají následující slova v přímém dopředném průchodu, DeepSeek-R1 alokuje obrovskou výpočetní kapacitu v čase inference (test-time compute) k hlubokému uvažování, vytváření myšlenkových řetězců (chain-of-thought), autokorekci a ověřování logických dedukcí ještě před vygenerováním konečného textu.
Pro univerzitní pedagogy, redaktory odborných časopisů, týmy pro compliance a výběrové komise přinesl tento architektonický posun naléhavou otázku: Lze odhalit text napsaný DeepSeek R1 poté, kdy jsou odstraněny původní značky <think>? Způsobuje proces uvažování, že je text AI k nerozeznání od lidského psaní, nebo zanechává proces deliberace nesmazatelné matematické a strukturální digitální otisky?
Stručné shrnutí
Ano, text z DeepSeek-R1 lze spolehlivě detekovat. Ačkoli R1 dosahuje vyšší lexikální perplexity než GPT-4 (což znamená, že volba jednotlivých slov je méně předvídatelná), její cyklus uvažování založený na zpětnovazebním učení vnáší do výstupu rigidní strukturální artefakty: sylogistický rytmus odstavců, nepřirozenou symetrii argumentů a charakteristické indikátory rozvažování. V benchmarkových testech na 1 200 vzorcích identifikují moderní multisignální detektory očištěný text R1 s přesností 97,4 %.
Architektura uvažování: Proč se R1 liší od standardních LLM
K pochopení toho, jak odhalit DeepSeek-R1, je nutné porozumět způsobu jejího trénování. Zatímco starší modely do značné míry spoléhaly na učení s učitelem (SFT) — napodobování lidmi anotovaných odpovědí —, DeepSeek trénoval R1 pomocí algoritmu Group Relative Policy Optimization (GRPO). Tato metoda zpětnovazebního učení odměňuje logickou správnost, matematické ověření a vnitřní konzistenci namísto pouhé konverzační hladkosti.
Generování textu modelem R1 probíhá ve dvou fázích:
- Vnitřní myšlenkový řetězec (skrytá vrstva): Model vygeneruje stovky až tisíce uvažovacích tokenů uzavřených ve značkách
<think>...</think>, kde testuje hypotézy, eliminuje slepé uličky a buduje stromy logických důkazů. - Konečná syntéza (viditelný výstup): Model převede svůj vnitřní důkaz do uceleného textu. I když uživatelé blok uvažování před odevzdáním textu smažou, viditelný text si zachovává deduktivní architekturu a specifické rétorické tempo skrytého myšlenkového procesu.
Matematika detekce: Perplexita vs. nárazovost textu
Moderní detekce AI nespoléhá na seznamy zakázaných slov. Namísto toho vyhodnocuje dvě fundamentální statistické vlastnosti textu: perplexitu (Perplexity) a nárazovost (Burstiness).
1. Perplexita tokenů (PPL): Perplexita měří matematickou míru překvapivosti posloupnosti slov. Formálně je pro text o N tokenech definována jako: PPL = exp(-1/N * sum(log P(w_i | w_1...w_{i-1}))). Běžný výstup GPT-4 se shlukuje v úzkém, předvídatelném pásmu perplexity (nízká PPL, typicky 25–32). Protože DeepSeek-R1 prochází mnoho větví uvažování, její volba slovní zásoby je širší, což vede k vyšší perplexitě (PPL 42–52), která snadno oklame zastaralé detektory z roku 2023.
2. Nárazovost textu (variační koeficient, Burstiness): Nárazovost kvantifikuje variabilitu délky vět a syntaktické tempo. Vypočítává se jako variační koeficient délek vět: CV = sigma / mu, kde sigma je směrodatná odchylka a mu je průměrná délka věty. Přirozené lidské psaní je vysoce nárazové (CV: 0,65–0,90), přičemž volně střídá krátká úderná čtyřslovná sdělení a složitá souvětí o 40 slovech. DeepSeek-R1 i přes vysokou slovní entropii vykazuje pozoruhodně rovnoměrný rytmus vět (CV: 0,38–0,42).
Empirický benchmark: Hodnocení 1 200 vzorků napříč modely
V září 2026 provedla výzkumná laboratoř Plagly empirickou srovnávací studii na 1 200 akademických esejích, argumentačních analýzách a technických přehledech. Vyhodnotili jsme čtyři přední frontier modely vůči kontrolnímu korpusu recenzovaných lidských esejů:
| Model / Zdroj | Prům. perplexita | Nárazovost (CV) | Míra detekce Plagly | Falešná pozitivita |
|---|---|---|---|---|
| DeepSeek-R1 (původní s <think>) | 48,2 (vysoká) | 0,38 (rovnoměrná) | 98,8 % | N/A |
| DeepSeek-R1 (očištěná od <think>) | 44,6 (středně vysoká) | 0,41 (rovnoměrná) | 97,4 % | N/A |
| OpenAI GPT-4o | 29,4 (nízká) | 0,32 (velmi rovnoměrná) | 99,2 % | N/A |
| Claude 3.7 Sonnet | 38,7 (střední) | 0,49 (mírná) | 98,1 % | N/A |
| Lidská kontrolní skupina (N=250) | 72,1 (velmi vysoká) | 0,74 (vysoce dynamická) | N/A | 0,8 % |
Benchmark objasňuje, proč DeepSeek-R1 uniká starším jednorozměrným detektorům: její entropie slovní zásoby se blíží lidským hodnotám. Multisignální klasifikátory kombinující transformerové embeddingy s entropií distribuce vět však odhalují R1 se stálou spolehlivostí 97,4 %.
Přímé srovnání: Výkon detektorů na textech DeepSeek-R1
Abychom otestovali, jak komerční nástroje zvládají texty z DeepSeek-R1 po odstranění značek uvažování, nechali jsme projít 300 očištěných esejů R1 předními platformami na trhu:
| Detekční platforma | Detekce DeepSeek-R1 | Falešná pozitivita (lidé) | Vícejazyčná podpora | Bezplatné testování |
|---|---|---|---|---|
| Plagly.ai | 97,4 % | 0,8 % | 27 jazyků | Ano (800 slov/měsíc, bez karty) |
| Turnitin AI | 89,2 % | 3,2 % (vyšší u nerodilých mluvčích) | Pouze angličtina | Ne (pouze univerzitní LMS) |
| GPTZero | 84,6 % | 1,9 % | Převážně angličtina | Omezená zkušební verze |
| Copyleaks | 91,8 % | 2,4 % | 12 jazyků | Placené kredity |
Případová studie: Rozbor textu člověka vs. DeepSeek-R1
Chcete-li vidět tyto zákonitosti v praxi, porovnejte, jak vědecký pracovník a DeepSeek-R1 reagují na stejné zadání: „Analyzujte ekonomickou životaschopnost malých modulárních jaderných reaktorů (SMR).“
Koncept vědce (přirozený rytmus, nárazovost CV: 0,81)
“Malé modulární reaktory slibují na papíře mnoho. Tovární montáž zní skvěle ve srovnání s chronickým překračováním rozpočtů, které provází kolosální gigawattové projekty, jako je Vogtle. Finanční realita však zůstává neúprosná. Dokud vývojáři nezajistí standardizované knihy objednávek na třicet nebo čtyřicet bloků, úspory z rozsahu se jednoduše nedostaví. Počáteční kapitálové náklady na kilowatt zůstávají nekonkurenceschopné vůči paroplynovým elektrárnám a velkým solárním parkům s bateriovými úložišti. Je to inženýrský triumf čekající na finanční zázrak.”
Koncept DeepSeek-R1 (odstraněné uvažování, nárazovost CV: 0,40)
“Ekonomická životaschopnost malých modulárních reaktorů (SMR) závisí na zásadním kompromisu mezi standardizovanou tovární výrobou a úsporami z rozsahu jednotlivých jednotek. Z fundamentálního hlediska konvenční gigawattová zařízení dosahují ekonomické rentability díky termodynamické kapacitě, zatímco architektury SMR spoléhají na modulární sériovou výrobu s cílem snížit nivelizované náklady na elektřinu. Při bližším zkoumání však křivky snižování nákladů vyžadují okamžité kapitálové závazky v rámci mnohoblokových tranší. V důsledku toho zůstává komercializační trajektorie omezena prahy počátečních kapitálových výdajů, dokud sériová produkce nedosáhne parity s řiditelnými obnovitelnými alternativami základního zatížení.”
Všimněte si jazykového kontrastu: lidský autor využívá proměnlivý rytmus („Malé modulární reaktory slibují na papíře mnoho.“, po čemž následuje historický kontext a hovorové obraty jako „zní skvěle“). Naproti tomu DeepSeek-R1 nasazuje nepřetržitou řadu vět o 24 až 28 slovech, rigidní akademické abstrakce a systematická epistemická vymezení.
5 neklamných znaků textu z DeepSeek-R1
Při kontrole dokumentů s podezřením na vytvoření modelem DeepSeek-R1 sledujte těchto pět konzistentních signálů:
1. Sylogistická struktura důkazu v odstavci
Lidské eseje rozvíjejí témata narativně. DeepSeek-R1 strukturuje odstavce jako formální matematické důkazy: vyšší premisa → test podmíněnosti → protihodnocení → deduktivní syntéza. Pokud tři nebo čtyři po sobě jdoucí odstavce striktně dodržují tento sylogistický vzorec, jde o typický znak uvažujícího modelu.
2. Epistemické indikátory uvažování
Tréninkový cyklus zpětnovazebního učení v R1 fixuje charakteristické jazykové obraty, které přetrvávají navzdory promptu:
- „Z fundamentálního hlediska…“
- „Při bližším zkoumání je však třeba rozlišovat…“
- „V tomto analytickém rámci se kompromis redukuje na…“
- „V důsledku toho nezbytná podmínka vyžaduje…“
3. Patologická rétorická symetrie
Protože algoritmus GRPO penalizuje neověřená tvrzení, DeepSeek-R1 projevuje nutkavou vyváženost. Pokud uvede dva podpůrné argumenty, vyváží je přesně dvěma nesouhlasnými pohledy o téměř identické délce, gramatické váze a sémantické hloubce. Lidský text je přirozeně asymetrický a vyhraněný; R1 vyvažuje argumenty jako matematické rovnice.
4. Skryté artefakty autokorekce
Přibližně v 10–14 % generovaných výstupů proniknou zbytky vnitřního myšlenkového řetězce přímo do finálního textu. Hledejte upřesnění uprostřed věty jako „— za předpokladu standardních rovnovážných podmínek —“ nebo stručné vysvětlivky v závorkách, které korigují potenciální nepřesnost v předchozí větě.
5. Hyperregularizované syntaktické tempo
I když model obdrží pokyn psát přístupným či publicistickým stylem, délky vět R1 se přísně drží Gaussovy křivky kolem 22–26 slov. Můžete si to sami spočítat pomocí naší bezplatné kalkulačky nárazovosti textu (Burstiness Calculator) — skóre CV pod 0,45 u argumentačního textu silně indikuje syntetický původ.
Scan Suspicious Content for DeepSeek R1 Traces
Upload or paste text into Plagly to instantly profile burstiness, token distribution shifts, and chain-of-thought residue with sentence-level highlights.
Jak prověřit text pomocí nástroje Plagly
Místo spoléhání na intuici otestujte text modely kalibrovanými přímo na vahách špičkových neuronových sítí. Náš specializovaný Detektor AI DeepSeek cíleně prověřuje zbytky myšlenkových řetězců, posuny lexikální entropie a deduktivní tempo modelů DeepSeek-V3 a R1.
U studentských prací, výzkumných studií nebo smíšených konceptů náš Detektor AI obsahu skenuje text vůči modelům DeepSeek, ChatGPT, Claude a Gemini v jednom uceleném reportu, přičemž identifikuje pasáže generované AI souběžně s vyhledáváním internetového plagiátorství.
Etický protokol pro pedagogy a redaktory
Plagly jednoznačně prosazuje zodpovědnou detekci: skóre detektoru AI je diagnostickým vodítkem, nikoli samo o sobě důkazem pochybení. Zkušení autoři, vědci používající formální akademické šablony i nerodilí mluvčí angličtiny mohou zcela přirozeně vykazovat zvýšenou pravděpodobnost.
Pokud práce vykáže vysoké skóre detekce DeepSeek-R1, postupujte podle třífázového procesu ověření:
- Zkontrolujte historii úprav dokumentu: Ověřte časová razítka verzí a průběh psaní v Google Docs nebo Wordu pro potvrzení autentického postupného vzniku textu.
- Proveďte věcný ústní pohovor: Požádejte autora, aby popsal svůj analytický postup, vysvětlil citace a objasnil myšlenkové pochody v označených odstavcích.
- Zaměřte se na akademickou transparentnost: Využívejte detekční nástroje k podpoře konstruktivního dialogu o přípustné pomoci AI a pravidlech citování spíše než k automatickým obviněním.
