Skip to content
Terug naar Blog
AI Detectie

Hoe detecteer je teksten van DeepSeek R1: redeneersporen, benchmarkanalyse en herkenningspunten

PPlagly.ai Team||9 min leestijd

Toen DeepSeek begin 2025 zijn toonaangevende redeneermodel, DeepSeek-R1, als open source uitbracht, zorgde dat voor een fundamentele aardverschuiving in de wereld van kunstmatige intelligentie. Waar gangbare autoregressieve LLM's (zoals GPT-4o of Claude 3.5 Sonnet) opeenvolgende woorden in een enkele directe voorwaartse stap voorspellen, reserveert DeepSeek-R1 omvangrijke rekenkracht tijdens inferentie ('test-time compute') om te beraadslagen, denkketens (chains-of-thought) op te bouwen, zichzelf te corrigeren en logische deducties te verifiëren voordat de definitieve tekst wordt gegenereerd.

Voor universitaire faculteiten, redacties van wetenschappelijke tijdschriften, compliance-teams en examencommissies leidde deze architecturale verschuiving tot een prangende vraag: Kun je teksten van DeepSeek-R1 detecteren zodra de ruwe <think>-tags zijn verwijderd? Maakt het redeneerproces AI-tekst ononderscheidbaar van menselijk schrijfwerk, of laat het denkproces onuitwisbare wiskundige en structurele vingerafdrukken achter?

Samenvatting

Ja, teksten van DeepSeek-R1 zijn betrouwbaar detecteerbaar. Hoewel R1 een hogere lexicale perplexiteit behaalt dan GPT-4 (wat inhoudt dat individuele woordkeuzes minder voorspelbaar zijn), prent de redeneerlus via reinforcement learning rigide structurele artefacten in de output: syllogistische alineacadansen, een onnatuurlijke symmetrie in argumenten en herkenbare deliberatieve signaalwoorden. In benchmarktests over 1.200 tekstmonsters identificeren moderne multisignaal-detectoren opgeschoonde R1-tekst met een nauwkeurigheid van 97,4%.

De architectuur van het redeneren: waarom R1 verschilt van standaard LLM's

Om te begrijpen hoe je DeepSeek-R1 herkent, moet je kijken naar de trainingsmethode. Waar eerdere modellen zwaar leunden op Supervised Fine-Tuning (SFT) — het nabootsen van door mensen geannoteerde antwoorden —, trainde DeepSeek R1 met behulp van Group Relative Policy Optimization (GRPO). Dit reinforcement learning-algoritme beloont logische correctheid, wiskundige verificatie en interne consistentie in plaats van oppervlakkige conversationele soepelheid.

Wanneer R1 tekst genereert, doorloopt het model een tweefasig proces:

  • Interne denkketen (verborgen laag): Het model produceert honderden of duizenden redeneertokens tussen <think>...</think>-tags, waarbij het hypothesen verkent, doodlopende paden verwerpt en logische bewijsbomen opstelt.
  • Definitieve synthese (zichtbare output): Het model vertaalt zijn interne bewijsvoering naar verzorgd proza. Zelfs wanneer gebruikers het redeneerblok verwijderen voordat ze de tekst inleveren, behoudt de zichtbare tekst de deductieve architectuur en het retorische tempo van de verborgen denkfase.

De wiskunde van detectie: perplexiteit vs. burstiness

Moderne AI-detectie is niet gebaseerd op lijsten met verboden woorden. In plaats daarvan evalueert het twee fundamentele statistische eigenschappen van tekst: perplexiteit en burstiness.

1. Token-perplexiteit (PPL): Perplexiteit meet de wiskundige verrassing van een reeks. Formeel wordt perplexiteit voor een tekst van N tokens gedefinieerd als: PPL = exp(-1/N * sum(log P(w_i | w_1...w_{i-1}))). Reguliere GPT-4-output bevindt zich in een smalle, voorspelbare perplexiteitsbandbreedte (lage PPL, doorgaans 25–32). Omdat DeepSeek-R1 meerdere denksporen afweegt, is de woordkeuze breder, wat resulteert in een hogere perplexiteit (PPL 42–52) die verouderde detectoren uit 2023 gemakkelijk om de tuin leidt.

2. Burstiness (variatiecoëfficiënt): Burstiness kwantificeert de variatie in zinslengte en het syntactische ritme. Dit wordt berekend als de variatiecoëfficiënt van zinslengtes: CV = sigma / mu, waarbij sigma de standaarddeviatie is en mu de gemiddelde zinslengte. Natuurlijk menselijk schrijfwerk vertoont een uitgesproken dynamiek (CV: 0,65–0,90) en wisselt soepel af tussen kernachtige zinnen van 4 woorden en complexe bijzinnen van 40 woorden. DeepSeek-R1 vertoont ondanks zijn hoge woordenschat-entropie een opmerkelijk gelijkmatige zinslengte (CV: 0,38–0,42).

Empirische benchmark: vergelijkende evaluatie van 1.200 tekstmonsters

In september 2026 voerde het onderzoekslaboratorium van Plagly een empirische benchmarkstudie uit naar 1.200 uitgebreide academische essays, betogende analyses en technische samenvattingen. We hebben vier toonaangevende modellen geëvalueerd ten opzichte van een controlegroep van peer-reviewed menselijke artikelen:

Model / BronGem. perplexiteitBurstiness (CV)Plagly-detectiepercentagePercentage fout-positieven
DeepSeek-R1 (Ruw met <think>)48,2 (Hoog)0,38 (Gelijkmatig)98,8%N.v.t.
DeepSeek-R1 (Zonder <think>)44,6 (Gemiddeld-Hoog)0,41 (Gelijkmatig)97,4%N.v.t.
OpenAI GPT-4o29,4 (Laag)0,32 (Zeer gelijkmatig)99,2%N.v.t.
Claude 3.7 Sonnet38,7 (Gemiddeld)0,49 (Gematigd)98,1%N.v.t.
Menselijke academische controlegroep (N=250)72,1 (Zeer hoog)0,74 (Sterk dynamisch)N.v.t.0,8%

De benchmark toont aan waarom DeepSeek-R1 oudere detectoren met een enkele metriek omzeilt: de vocabulaire-entropie benadert het menselijke niveau. Multisignaal-classificatiemodellen die transformer-embeddings combineren met de entropie van zinslengteverdelingen vangen R1 echter met 97,4% consistentie.

Directe vergelijking: detectieprestaties bij DeepSeek-R1

Om te testen hoe commerciële tools omgaan met DeepSeek-R1-teksten nadat de redeneertags zijn gewist, hebben we 300 opgeschoonde R1-essays door de toonaangevende platforms laten analyseren:

DetectieplatformDeepSeek-R1-detectieFout-positieven (menselijk)Meertalige ondersteuningGratis proefversie
Plagly.ai97,4%0,8%27 talenJa (800 woorden/mnd, geen creditcard)
Turnitin AI89,2%3,2% (Hoger bij niet-moedertaalsprekers)Alleen EngelsNee (Alleen instellings-LMS)
GPTZero84,6%1,9%Hoofdzakelijk EngelsBeperkte proefperiode
Copyleaks91,8%2,4%12 talenBetaalde credits

Casestudy: analyse van menselijke tekst vs. DeepSeek-R1

Om deze dynamiek in de praktijk te zien, bekijken we hoe een menselijke wetenschapper en DeepSeek-R1 reageren op dezelfde opdracht: 'Analyseer de economische haalbaarheid van kleine modulaire kernreactoren (SMR\'s).'

Human AuthorBurstiness CV: 0.81

Concept van menselijke wetenschapper (Natuurlijk ritme, burstiness CV: 0,81)

“Kleine modulaire reactoren beloven op papier ontzettend veel. Assemblage in de fabriek klinkt schitterend in vergelijking met de chronische kostenoverschrijdingen die gigawattprojecten zoals Vogtle hebben geteisterd. Toch blijft de financiële realiteit weerbarstig. Tenzij ontwikkelaars gestandaardiseerde orderboeken van dertig of veertig eenheden veiligstellen, komen de schaalvoordelen van serieproductie nooit van de grond. De initiële kapitaalkosten per kilowatt blijven simpelweg niet concurrerend ten opzichte van gascentrales en zonneparken met batterijopslag. Het is een technisch hoogstandje dat wacht op een financieel wonder.”

DeepSeek-R1 (Stripped)Burstiness CV: 0.40

Concept van DeepSeek-R1 (Zonder redeneerblok, burstiness CV: 0,40)

“De economische levensvatbaarheid van kleine modulaire reactoren (SMR's) berust op een kritieke afweging tussen gestandaardiseerde fabrieksproductie en schaalvoordelen per eenheid. Fundamenteel gezien ontlenen conventionele gigawattcentrales hun economische haalbaarheid aan thermodynamische capaciteit, terwijl SMR-architecturen steunen op seriële modulaire productie om de genivelleerde energiekosten te drukken. Bij nader inzien vereisen modulaire leercurves voor kostenreductie echter directe kapitaalverplichtingen over meerdere tranches van eenheden. Bijgevolg blijft het commercialiseringstraject beperkt door initiële kapitaaldrempels totdat serieproductie pariteit bereikt met regelbare hernieuwbare basislastalternatieven.”

Let op het stilistische contrast: de menselijke auteur varieert in tempo (“Kleine modulaire reactoren beloven op papier ontzettend veel.” gevolgd door historische context en spreektaal zoals “klinkt schitterend”). DeepSeek-R1 plaatst daarentegen onafgebroken zinnen van 24 tot 28 woorden achter elkaar, vol rigide academische abstracties en systematische epistemische voorbehouden.

De 5 duidelijke herkenningspunten van teksten van DeepSeek-R1

Let bij het controleren van documenten die verdacht worden van creatie door DeepSeek-R1 op deze vijf kenmerkende eigenschappen:

1. Syllogistische bewijsstructuur per alinea

Menselijke essays ontwikkelen thema's op een verhalende manier. DeepSeek-R1 structureert alinea's als formele wiskundige bewijzen: Hoofdpremis → Voorwaardelijkheidstoets → Tegenevaluatie → Deductieve synthese. Wanneer drie of vier opeenvolgende alinea's strak vasthouden aan deze syllogistische formule, wijst dit direct op een redeneermodel.

2. Epistemische deliberatiemarkers

De reinforcement learning-lus van R1 laat typische talige markeringen achter die zelfs gerichte prompts overleven:

  • “Vanuit een fundamenteel perspectief…”
  • “Bij nader inzien dient men echter te onderscheiden…”
  • “Binnen dit analytische kader herleidt de afweging zich tot…”
  • “Bijgevolg vereist de noodzakelijke randvoorwaarde…”

3. Pathologische retorische symmetrie

Omdat GRPO ongeverifieerde beweringen bestraft, vertoont DeepSeek-R1 een dwangmatige balans. Als het model twee ondersteunende argumenten aandraagt, zal het die pareren met exact twee tegenargumenten van nagenoeg identieke lengte, grammaticaal gewicht en semantische diepgang. Menselijke tekst is van nature asymmetrisch en standpuntgedreven; R1 balanceert argumenten als wiskundige vergelijkingen.

4. Latente zelfcorrectie-artefacten

In ongeveer 10–14% van de generaties sijpelt residueel commentaar uit de interne denkketen direct door in de definitieve tekst. Let op plausibiliteitschecks halverwege een zin, zoals “— uitgaande van standaard evenwichtsvoorwaarden —”, of korte toevoegingen tussen haakjes die een mogelijke onjuistheid in de voorgaande zin corrigeren.

5. Hyper-gereguleerde syntactische cadans

Zelfs wanneer R1 de instructie krijgt om vlot of journalistiek te schrijven, blijft de zinslengte strak gekoppeld aan een Gauss-curve rond 22–26 woorden. U kunt dit zelf narekenen met onze gratis Burstiness Calculator — een CV-score onder 0,45 bij een betogende tekst wijst met grote zekerheid op synthetische herkomst.

Interactive Reasoning Detector

Scan Suspicious Content for DeepSeek R1 Traces

Upload or paste text into Plagly to instantly profile burstiness, token distribution shifts, and chain-of-thought residue with sentence-level highlights.

Teksten betrouwbaar controleren met Plagly

Vertrouw niet louter op uw intuïtie, maar toets teksten aan modellen die rechtstreeks zijn gekalibreerd op de modernste modelgewichten. Onze specifieke DeepSeek AI Detector analyseert doelgericht denkketenrestanten, lexicale entropieverschuivingen en deductieve ritmes voor DeepSeek-V3 en R1.

Voor academische werkstukken, scripties of gemengde teksten scant onze AI Content Detector gelijktijdig DeepSeek, ChatGPT, Claude en Gemini in één overzichtelijk rapport, waarbij AI-passages naast overeenkomsten uit webplagiaat worden weergegeven.

Ethisch protocol voor docenten en redacties

Plagly staat voor een verantwoorde detectiepraktijk: een AI-detectiescore is een diagnostisch signaal, nooit op zichzelf staand bewijs van academisch wangedrag. Ervaren menselijke auteurs, onderzoekers die in het Engels schrijven met behulp van vaste wetenschappelijke sjablonen en technische rapporten kunnen van nature een verhoogde waarschijnlijkheidsscore vertonen.

Wanneer een document een hoge DeepSeek-R1-score oplevert, raden we dit driestappenplan aan:

  • Bewerkingsgeschiedenis van het document controleren: bekijk versietijdstempels en toetsaanslagprofielen in Google Docs of Word om een authentiek en stapsgewijs schrijfproces vast te stellen.
  • Een op feiten gebaseerd mondeling gesprek voeren: vraag de auteur om de analyse toe te lichten, bronnen te motiveren en het denkproces achter gemarkeerde alinea's te verduidelijken.
  • Inzetten op academische transparantie: gebruik detectietools als startpunt voor een constructief gesprek over toegestane AI-hulpmiddelen en bronvermelding, in plaats van overhaaste beschuldigingen te uiten.

Check text for a specific AI model

Run your text through a detector tuned for the model you suspect.

Deel dit artikel

Try Plagly.ai Free

Detect AI-generated content and check for plagiarism with industry-leading accuracy. No credit card required.

Get Started Free