Skip to content
Tilbage til bloggen
AI-detektering

Sådan opdages DeepSeek R1 AI-tekst: Ræsonnementsspor, benchmarkanalyse og afslørende tegn

PPlagly.ai-teamet||9 min læsning

Da DeepSeek frigav sin førende ræsonneringsmodel som open source, DeepSeek-R1, i begyndelsen af 2025, forandrede det kunstig intelligens fundamentalt. Mens traditionelle autoregressive sprogmodeller (såsom GPT-4o eller Claude 3.5 Sonnet) forudsiger efterfølgende ord i et direkte fremadrettet gennemløb, allokerer DeepSeek-R1 massiv regnekraft under inferens ('test-time compute') til at overveje, opbygge tankekæder (chains-of-thought), selvkorrigere og verificere logiske deduktioner, før den producerer sin endelige tekst.

For universitetsfakulteter, tidsskriftredaktører, compliance-teams og ansættelsesudvalg rejste dette arkitektoniske skifte et påtrængende spørgsmål: Kan man opdage tekst skrevet af DeepSeek R1, når de rå <think>-tags fjernes? Gør ræsonnementsprocessen AI-tekst umulig at skelne fra menneskelig skrift, eller efterlader overvejelsesprocessen uudslettelige matematiske og strukturelle fingeraftryk?

Resumé

Ja, tekst fra DeepSeek-R1 kan pålideligt detekteres. Selvom R1 opnår en højere leksikalsk perpleksitet end GPT-4 (hvilket betyder, at individuelle ordvalg er mindre forudsigelige), indbygger dens forstærkende ræsonnementssløjfe rigide strukturelle artefakter i teksten: syllogistisk afsnitskadence, unaturlig argumentsymmetri og deliberative overgangsmarkører. I benchmark-evalueringer på tværs af 1.200 tekstprøver identificerer moderne multisignal-detektorer renset R1-tekst med 97,4 % nøjagtighed.

Ræsonnementets arkitektur: Hvorfor R1 adskiller sig fra standard-LLM'er

For at forstå hvordan man afslører DeepSeek-R1, må man forstå, hvordan modellen blev trænet. Hvor tidligere modeller i høj grad baserede sig på overvåget finjustering (SFT, Supervised Fine-Tuning) — at efterligne menneskeligt annoterede svar — trænede DeepSeek R1 ved hjælp af Group Relative Policy Optimization (GRPO). Denne algoritme til forstærkende læring belønner logisk korrekthed, matematisk verifikation og intern konsistens frem for en overfladisk samtaleflyd.

Når R1 genererer tekst, gennemgår den en totrins proces:

  • Intern tankekæde (skjult lag): Modellen genererer hundreder eller tusinder af ræsonneringstokens omsluttet af <think>...</think>-tags, hvor den udforsker hypoteser, kasserer blindgyder og etablerer bevistræer.
  • Endelig syntese (synlig tekst): Modellen oversætter sit interne bevis til ren prosa. Selv når brugere sletter ræsonnementsblokken, før teksten afleveres, bevarer den synlige prosa den deduktive arkitektur og det retoriske tempo fra den skjulte overvejelse.

Detekteringens matematik: Perpleksitet vs. Burstiness

Moderne AI-detektering baserer sig ikke på tjeklister med forbudte ord. I stedet evaluerer den to grundlæggende statistiske egenskaber ved teksten: Perpleksitet og Burstiness.

1. Token-perpleksitet (PPL): Perpleksitet måler den matematiske overraskelse i en sekvens. Formelt defineres perpleksitet for en tekst på N tokens som: PPL = exp(-1/N * sum(log P(w_i | w_1...w_{i-1}))). Standardoutput fra GPT-4 samler sig i et snævert, forudsigeligt perpleksitetsbånd (lav PPL, typisk 25–32). Fordi DeepSeek-R1 udforsker flere ræsonneringsgrene, er dens ordforråd bredere, hvilket resulterer i en højere perpleksitet (PPL 42–52), der nemt narrer ældre detektorer fra 2023.

2. Burstiness (variationskoefficient): Burstiness kvantificerer variation i sætningslængde og syntaktisk tempo. Det beregnes som variationskoefficienten for sætningslængder: CV = sigma / mu, hvor sigma er standardafvigelsen, og mu er den gennemsnitlige sætningslængde. Naturlig menneskelig skrift har høj burstiness (CV: 0,65–0,90) og veksler ubesværet mellem korte, præcise sætninger på 4 ord og komplekse ledsætninger på 40 ord. DeepSeek-R1 udviser trods sin høje ordforrådsentropi en bemærkelsesværdigt ensartet sætningsrytme (CV: 0,38–0,42).

Empirisk benchmark: Evaluering på tværs af 1.200 tekstprøver

I september 2026 gennemførte Plaglys forskningslaboratorium en empirisk sammenligningsundersøgelse af 1.200 akademiske essays i fuld længde, argumenterende analyser og tekniske resuméer. Vi evaluerede fire førende spydspidsmodeller mod et kontrolkorpus af fagfællebedømte menneskelige essays:

Model / KildeGns. perpleksitetBurstiness (CV)Plagly detektionsrateFalsk positiv-rate
DeepSeek-R1 (Rå med <think>)48,2 (Høj)0,38 (Ensartet)98,8%Ikke relevant
DeepSeek-R1 (Renset <think>)44,6 (Mellemhøj)0,41 (Ensartet)97,4%Ikke relevant
OpenAI GPT-4o29,4 (Lav)0,32 (Meget ensartet)99,2%Ikke relevant
Claude 3.7 Sonnet38,7 (Middel)0,49 (Moderat)98,1%Ikke relevant
Menneskelig akademisk kontrol (N=250)72,1 (Meget høj)0,74 (Meget dynamisk)Ikke relevant0,8%

Dette benchmark belyser, hvorfor DeepSeek-R1 undgår ældre enkeltparameter-detektorer: dens ordforrådsentropi ligner menneskelige niveauer. Multisignal-klassifikatorer, der kombinerer transformer-indlejringer med sætningsfordelingsentropi, fanger dog R1 med 97,4 % konsistens.

Direkte duel: Detektorydeevne på DeepSeek-R1

For at teste hvordan kommercielle værktøjer håndterer tekster fra DeepSeek-R1, når ræsonneringstags er slettet, kørte vi 300 rensede R1-essays gennem de førende platforme på markedet:

DetektionsplatformDeepSeek-R1-detekteringFalske positive på menneskelig tekstFlersproget supportGratis testversion
Plagly.ai97,4%0,8%27 sprogJa (800 ord/md., intet kort)
Turnitin AI89,2%3,2 % (Højere for ikke-modersmålstalende)Kun engelskNej (Kun enterprise LMS)
GPTZero84,6%1,9%Primært engelskBegrænset prøveperiode
Copyleaks91,8%2,4%12 sprogBetalte kreditter

Casestudie: Analyse af menneskelig tekst over for DeepSeek-R1

For at se disse dynamikker i aktion kan man undersøge, hvordan en menneskelig forsker kontra DeepSeek-R1 besvarer samme instruks: 'Analyser den økonomiske levedygtighed af små modulære atomreaktorer (SMR).'

Human AuthorBurstiness CV: 0.81

Udkast fra menneskelig forsker (Naturlig kadence, Burstiness CV: 0,81)

“Små modulære reaktorer lover meget på papiret. Fabriksmontering lyder genialt sammenlignet med de kroniske omkostningsoverskridelser, der har plaget kolossale gigawatt-projekter som Vogtle. Alligevel forbliver den finansielle virkelighed genstridig. Medmindre udviklere kan sikre standardiserede ordrebøger på tredive eller fyrre enheder, vil stordriftsfordele i produktionen aldrig realiseres. Den oprindelige kapitalomkostning pr. kilowatt forbliver ganske enkelt ukonkurrencedygtig i forhold til gas med kombicyklus og storskala solenergi med batterilagring. Det er en ingeniørmæssig triumf, der venter på et økonomisk mirakel.”

DeepSeek-R1 (Stripped)Burstiness CV: 0.40

Udkast fra DeepSeek-R1 (Fjernet ræsonnement, Burstiness CV: 0,40)

“Den økonomiske levedygtighed af små modulære reaktorer (SMR) beror på en kritisk afvejning mellem standardiseret fabriksproduktion og stordriftsfordele pr. enhed. Fra et grundlæggende synspunkt henter konventionelle anlæg i gigawatt-skala deres økonomiske gennemførlighed fra termodynamisk kapacitet, mens SMR-arkitekturer baserer sig på modulær serieproduktion for at nedbringe de udjævnede energiomkostninger. Ved nærmere undersøgelse kræver modulære læringskurver for omkostningsreduktion dog umiddelbare kapitalforpligtelser over trancher af flere enheder. Følgelig forbliver kommercialiseringsbanen begrænset af indledende investeringstærskler, indtil serieproduktion opnår paritet med regulerbare vedvarende grundlastalternativer.”

Læg mærke til den sproglige kontrast: den menneskelige forfatter varierer rytmen (“Små modulære reaktorer lover meget på papiret.” efterfulgt af historisk kontekst og uformelle udtryk som “lyder genialt”). DeepSeek-R1 anvender derimod en uafbrudt række af sætninger på 24 til 28 ord, rigide akademiske abstraktioner og systematiske epistemiske forbehold.

De 5 tydeligste kendetegn ved DeepSeek-R1-skrivning

Når du undersøger dokumenter, der mistænkes for at være genereret af DeepSeek-R1, bør du kigge efter disse fem konsistente signaturer:

1. Den syllogistiske bevisstruktur i afsnit

Menneskelige essays udvikler temaer narrativt. DeepSeek-R1 strukturerer afsnit som formelle matematiske beviser: Hovedpræmis → Betingelsestest → Modevaluering → Deduktiv syntese. Når tre eller fire på hinanden følgende afsnit følger denne syllogistiske formel slavisk, er det et sikkert tegn på en ræsonnerende model.

2. Epistemiske overvejelsesmarkører

R1's forstærkende læringsløkke efterlader vanemæssige sproglige markører, der overlever promptinstruktioner:

  • “Fra et grundlæggende synspunkt…”
  • “Ved nærmere undersøgelse må man dog skelne mellem…”
  • “Under denne analytiske ramme reduceres afvejningen til…”
  • “Følgelig kræver den nødvendige forudsætning…”

3. Patologisk retorisk symmetri

Fordi GRPO straffer ubekræftede påstande, udviser DeepSeek-R1 en tvangspræget balance. Hvis den formulerer to støttende argumenter, vil den svare igen med nøjagtig to modargumenter af praktisk talt identisk længde, grammatisk vægt og semantisk dybde. Menneskelig prosa er naturligt ujævn og perspektivdrevet; R1 afbalancerer argumenter som matematiske ligninger.

4. Latente artefakter fra selvkorrektion

I cirka 10–14 % af generationerne siver samtalerester fra den interne tankekæde direkte ud i den endelige tekst. Hold øje med virkelighedstjek midt i sætninger som “— under antagelse af standardmæssige ligevægtsforhold —” eller korte parentetiske forbehold, der adresserer potentielle fejl i den foregående sætning.

5. Hyper-regulariseret syntaktisk tempo

Selv når den instrueres i at skrive i en tilgængelig eller journalistisk stil, klynger R1's sætningslængder sig tæt til en Gaussisk klokkekurve på 22–26 ord. Du kan selv beregne dette med vores gratis Burstiness-beregner — en CV-score under 0,45 i en argumenterende tekst er en stærk indikator på syntetisk generering.

Interactive Reasoning Detector

Scan Suspicious Content for DeepSeek R1 Traces

Upload or paste text into Plagly to instantly profile burstiness, token distribution shifts, and chain-of-thought residue with sentence-level highlights.

Sådan undersøger du tekst med Plagly

I stedet for at stole på mavefornemmelsen kan du teste din tekst mod modeller, der er kalibreret direkte mod de førende modelvægte. Vores dedikerede DeepSeek AI-detektor undersøger specifikt rester fra tankekæder, skift i leksikalsk entropi og deduktiv kadence for DeepSeek-V3 og R1.

Til akademiske afleveringer, forskningsartikler eller blandede kladder scanner vores AI-indholdsdetektor på tværs af DeepSeek, ChatGPT, Claude og Gemini i en samlet rapport og identificerer AI-genererede passager side om side med webplagiat-matches.

Etisk protokol for undervisere og redaktører

Plagly støtter stærkt ansvarlig detektering: en AI-detektionsscore er diagnostisk dokumentation, aldrig et bevis på snyd i sig selv. Dygtige menneskelige forfattere, akademikere med et andet modersmål, der anvender formelle akademiske skabeloner, og tekniske forskere kan helt naturligt opnå forhøjede sandsynlighedsscorer.

Hvis en opgave viser en høj DeepSeek-R1-detektionsscore, anbefales denne tretrins verifikationsproces:

  • Gennemgå dokumentets redigeringshistorik: Kontroller tidsstempler og tastetryksekvenser i Google Docs eller Word for at bekræfte en autentisk og iterativ skriveproces.
  • Gennemfør en evidensbaseret mundtlig samtale: Bed forfatteren om at redegøre for sin analyseproces, forklare sine kilder og gennemgå sit ræsonnement for de markerede afsnit.
  • Fokuser på akademisk gennemsigtighed: Brug detektionsværktøjer til at fremme konstruktiv dialog om tilladt AI-assistance og kildeangivelser frem for automatiserede beskyldninger.

Tjek tekst for en specifik AI-model

Kør din tekst gennem en detektor, der er tilpasset den model, du mistænker.

Del denne artikel

Prøv Plagly.ai gratis

Detekter AI-genereret indhold og tjek for plagiat med brancheførende nøjagtighed. Intet kreditkort påkrævet.

Get Started Free