Skip to content
Volver al Blog
Detección de IA

Cómo detectar textos de DeepSeek R1: huellas de razonamiento, benchmark y señales clave

PEquipo Plagly.ai||9 min de lectura

Cuando DeepSeek lanzó como código abierto su modelo insignia de razonamiento, DeepSeek-R1, a principios de 2025, transformó de raíz el panorama de la inteligencia artificial. Mientras que los LLM autorregresivos convencionales (como GPT-4o o Claude 3.5 Sonnet) predicen las palabras siguientes en una pasada directa hacia adelante, DeepSeek-R1 destina una gran cantidad de cómputo en tiempo de inferencia ('test-time compute') a deliberar, construir cadenas de pensamiento (chains-of-thought), autocorregirse y verificar deducciones lógicas antes de generar su prosa definitiva.

Para el profesorado universitario, comités editoriales, equipos de cumplimiento y tribunales evaluadores, este cambio arquitectónico planteó una pregunta apremiante: ¿Es posible detectar los textos de DeepSeek-R1 una vez eliminadas las etiquetas sin procesar <think>? ¿Acaso el razonamiento hace que el texto generado por IA resulte indistinguible de la redacción humana, o el proceso de deliberación deja huellas matemáticas y estructurales imborrables?

Resumen ejecutivo

Sí, el texto de DeepSeek-R1 se detecta de forma fiable. Aunque R1 alcanza una perplejidad léxica más alta que GPT-4 (lo que significa que la elección individual del vocabulario es menos predecible), su bucle de razonamiento por aprendizaje por refuerzo introduce patrones estructurales rígidos en la salida: cadencia silogística en los párrafos, una simetría argumental antinatural y conectores deliberativos recurrentes. En evaluaciones de referencia con 1.200 muestras, los detectores multiseñal modernos identifican la prosa de R1 sin etiquetas con una precisión del 97,4 %.

La arquitectura del razonamiento: por qué R1 se diferencia de los LLM estándar

Para comprender cómo identificar DeepSeek-R1, es necesario conocer su proceso de entrenamiento. Mientras que los modelos anteriores dependían en gran medida del ajuste fino supervisado (SFT) —imitando respuestas anotadas por humanos—, DeepSeek entrenó R1 mediante Group Relative Policy Optimization (GRPO). Este algoritmo de aprendizaje por refuerzo premia la corrección lógica, la verificación matemática y la coherencia interna en lugar de la fluidez conversacional.

Al generar texto, R1 atraviesa un proceso en dos fases:

  • Cadena de pensamiento interna (capa oculta): el modelo genera cientos o miles de tokens de razonamiento encapsulados en etiquetas <think>...</think>, explorando hipótesis, descartando callejones sin salida y construyendo árboles de prueba.
  • Síntesis final (salida visible): el modelo traduce su demostración interna a una prosa limpia. Incluso cuando los usuarios borran el bloque de razonamiento antes de entregar el texto, la redacción visible conserva la arquitectura deductiva y el ritmo retórico de la deliberación oculta.

La matemática de la detección: perplejidad vs. variabilidad (burstiness)

La detección moderna de IA no se basa en listas de palabras prohibidas. En su lugar, evalúa dos propiedades estadísticas fundamentales del texto: la perplejidad y la variabilidad sintáctica.

1. Perplejidad de tokens (PPL): la perplejidad mide la sorpresa matemática de una secuencia. Formalmente, para un texto de N tokens, se define como: PPL = exp(-1/N * sum(log P(w_i | w_1...w_{i-1}))). El texto estándar de GPT-4 se concentra en una franja de perplejidad estrecha y predecible (PPL baja, normalmente 25–32). Como DeepSeek-R1 explora múltiples ramas de razonamiento, su repertorio de vocabulario es más amplio, lo que arroja una perplejidad mayor (PPL 42–52) que engaña con facilidad a los detectores obsoletos de 2023.

2. Variabilidad sintáctica (coeficiente de variación): la variabilidad cuantifica la variación en la longitud de las oraciones y el ritmo sintáctico. Se calcula como el coeficiente de variación de la longitud de las oraciones: CV = sigma / mu, donde sigma es la desviación estándar y mu es la longitud media de las frases. La redacción humana espontánea es sumamente variable (CV: 0,65–0,90), alternando con soltura afirmaciones directas de 4 palabras y oraciones complejas de 40 palabras. DeepSeek-R1, a pesar de su elevada entropía de vocabulario, muestra una cadencia oracional extraordinariamente uniforme (CV: 0,38–0,42).

Benchmark empírico: evaluación comparativa de 1.200 muestras entre modelos

En septiembre de 2026, el laboratorio de investigación de Plagly llevó a cabo un estudio de referencia empírico sobre 1.200 ensayos académicos extensos, análisis argumentativos y resúmenes técnicos. Evaluamos cuatro modelos punteros frente a un corpus de control de ensayos humanos revisados por pares:

Modelo / FuentePerplejidad mediaVariabilidad (CV)Tasa de detección de PlaglyTasa de falsos positivos
DeepSeek-R1 (Sin procesar con <think>)48,2 (Alta)0,38 (Uniforme)98,8 %N/A
DeepSeek-R1 (Sin etiquetas <think>)44,6 (Media-Alta)0,41 (Uniforme)97,4 %N/A
OpenAI GPT-4o29,4 (Baja)0,32 (Muy uniforme)99,2 %N/A
Claude 3.7 Sonnet38,7 (Media)0,49 (Moderada)98,1 %N/A
Control académico humano (N=250)72,1 (Muy alta)0,74 (Muy dinámica)N/A0,8 %

Este benchmark pone en evidencia por qué DeepSeek-R1 esquiva a los detectores antiguos basados en una sola métrica: su entropía léxica imita los niveles humanos. Sin embargo, los clasificadores multiseñal que combinan representaciones de transformadores con la entropía de distribución de oraciones detectan R1 con una regularidad del 97,4 %.

Comparativa directa: rendimiento de los detectores frente a DeepSeek-R1

Para evaluar cómo gestionan las herramientas comerciales los textos de DeepSeek-R1 una vez eliminadas las etiquetas de razonamiento, sometimos 300 ensayos de R1 sin etiquetas a las plataformas líderes del mercado:

Plataforma de detecciónDetección de DeepSeek-R1Falsos positivos (humanos)Soporte multilingüeNivel de prueba gratuito
Plagly.ai97,4 %0,8 %27 idiomasSí (800 palabras/mes, sin tarjeta)
Turnitin AI89,2 %3,2 % (Mayor en no nativos)Solo inglésNo (Solo LMS institucional)
GPTZero84,6 %1,9 %Principalmente inglésPrueba limitada
Copyleaks91,8 %2,4 %12 idiomasCréditos de pago

Estudio de caso: disección de texto humano vs. DeepSeek-R1

Para observar esta dinámica en acción, analicemos cómo responden un investigador humano y DeepSeek-R1 a la misma instrucción: 'Analice la viabilidad económica de los reactores nucleares modulares pequeños (SMR).'

Human AuthorBurstiness CV: 0.81

Borrador de un investigador humano (Cadencia natural, variabilidad CV: 0,81)

“Los reactores modulares pequeños prometen mucho sobre el papel. El ensamblaje en fábrica suena brillante si se compara con los sobrecostes crónicos que han castigado a proyectos colosales de gigavatios como Vogtle. Sin embargo, la realidad financiera sigue siendo inflexible. A menos que los promotores consigan carteras de pedidos estandarizados de treinta o cuarenta unidades, las ventajas productivas nunca llegan a cristalizar. El coste de capital inicial por kilovatio sencillamente no compite frente a los ciclos combinados de gas ni frente a las plantas solares con almacenamiento. Es un triunfo de la ingeniería a la espera de un milagro financiero.”

DeepSeek-R1 (Stripped)Burstiness CV: 0.40

Borrador de DeepSeek-R1 (Razonamiento eliminado, variabilidad CV: 0,40)

“La viabilidad económica de los reactores modulares pequeños (SMR) depende de una correlación crítica entre la fabricación estandarizada en fábrica y las economías de escala de unidad. Desde una perspectiva fundacional, las centrales convencionales de escala de gigavatios fundamentan su viabilidad económica en la capacidad termodinámica, mientras que las arquitecturas SMR se apoyan en la fabricación modular seriada para mitigar los costes nivelados. Al examinarlo con mayor detenimiento, las curvas de aprendizaje de reducción de costes modulares exigen compromisos inmediatos de capital a través de bloques de múltiples unidades. En consecuencia, la trayectoria de comercialización permanece condicionada por los umbrales de inversión de capital inicial hasta que la producción en serie alcance la paridad con las alternativas de carga base renovables gestionables.”

Observe el contraste estilístico: el autor humano recurre a un ritmo variado (“Los reactores modulares pequeños prometen mucho sobre el papel.” seguido de contexto histórico y expresiones coloquiales como “suena brillante”). DeepSeek-R1, por el contrario, encadena de manera ininterrumpida oraciones de 24 a 28 palabras, cargadas de abstracciones académicas rígidas y continuos matices epistémicos.

Los 5 signos delatores inequívocos de la redacción de DeepSeek-R1

Al auditar documentos sospechosos de haber sido generados con DeepSeek-R1, preste atención a estos cinco rasgos característicos:

1. Estructura silogística de demostración por párrafos

Los ensayos humanos desarrollan los temas con un hilo narrativo. DeepSeek-R1 estructura los párrafos a modo de demostraciones matemáticas formales: Premisa mayor → Prueba de condicionalidad → Contraevaluación → Síntesis deductiva. Cuando tres o cuatro párrafos consecutivos siguen al pie de la letra esta fórmula silogística, es un claro indicio de un modelo de razonamiento.

2. Marcadores deliberativos epistémicos

El bucle de aprendizaje por refuerzo de R1 deja marcas léxicas recurrentes que persisten a pesar de los prompts:

  • “Desde una perspectiva fundacional…”
  • “Al examinarlo con mayor detenimiento, sin embargo, conviene distinguir…”
  • “Bajo este marco analítico, el dilema se reduce a…”
  • “En consecuencia, la condición indispensable requiere…”

3. Simetría retórica patológica

Dado que GRPO penaliza las afirmaciones no verificadas, DeepSeek-R1 muestra un equilibrio compulsivo. Si plantea dos argumentos a favor, contrapondrá exactamente dos perspectivas discordantes con una extensión, peso gramatical y profundidad semántica prácticamente idénticos. La prosa humana es asimétrica y refleja posturas personales de forma natural; R1 equilibra argumentos como si fueran ecuaciones.

4. Restos latentes de autocorrección

En aproximadamente el 10–14 % de las generaciones, residuos discursivos de la cadena de pensamiento interna se filtran directamente al texto final. Busque comprobaciones de coherencia a mitad de frase como “— asumiendo condiciones estándar de equilibrio —” o breves advertencias parentéticas que subsanan posibles errores de la oración previa.

5. Cadencia sintáctica hiperregularizada

Incluso cuando se le solicita un estilo distendido o periodístico, la longitud de las oraciones de R1 se aferra rígidamente a una campana de Gauss de entre 22 y 26 palabras. Puede calcularlo usted mismo con nuestra Calculadora de Burstiness gratuita — un valor de CV inferior a 0,45 en un texto argumentativo apunta con fuerza a una autoría sintética.

Interactive Reasoning Detector

Scan Suspicious Content for DeepSeek R1 Traces

Upload or paste text into Plagly to instantly profile burstiness, token distribution shifts, and chain-of-thought residue with sentence-level highlights.

Cómo auditar textos con Plagly

En lugar de fiarse de la intuición, contraste sus textos con modelos calibrados directamente con los pesos de los sistemas más avanzados. Nuestro Detector de IA DeepSeek analiza específicamente residuos de cadenas de pensamiento, desplazamientos de entropía léxica y patrones de cadencia deductiva para DeepSeek-V3 y R1.

Para trabajos académicos, artículos de investigación o borradores mixtos, nuestro Detector de Contenido IA examina simultáneamente DeepSeek, ChatGPT, Claude y Gemini en un único informe, identificando pasajes generados por IA junto con coincidencias de plagio en la web.

Protocolo ético para docentes y editores

Plagly promueve firmemente una detección responsable: una puntuación de detección de IA es una evidencia diagnóstica, nunca una prueba concluyente de falta académica por sí sola. Autores humanos experimentados, investigadores no nativos que usan plantillas formales y redactores técnicos pueden registrar de forma natural puntuaciones de probabilidad elevadas.

Si un documento obtiene una puntuación alta de DeepSeek-R1, aplique este procedimiento de verificación en tres pasos:

  • Revisar el historial de ediciones del documento: examine marcas temporales y el registro de pulsaciones en Google Docs o Word para verificar un proceso de redacción iterativo y auténtico.
  • Realizar una entrevista oral basada en evidencias: solicite al autor que explique su proceso de análisis, justifique sus citas y detalle el razonamiento de los párrafos señalados.
  • Fomentar la transparencia académica: utilice las herramientas de detección para abrir un diálogo formativo sobre el uso admisible de la IA y el deber de citación, evitando acusaciones automáticas.

Comprobar texto para un modelo de IA específico

Analice su texto con un detector adaptado al modelo que sospecha.

Compartir este artículo

Pruebe Plagly.ai Gratis

Detecte contenido generado por IA y verifique el plagio con precisión líder en la industria. No se requiere tarjeta de crédito.

Get Started Free