Quando a DeepSeek disponibilizou em código aberto o seu modelo de raciocínio de referência, o DeepSeek-R1, no início de 2025, transformou profundamente o ecossistema da inteligência artificial. Enquanto os LLMs autorregressivos tradicionais (como o GPT-4o ou o Claude 3.5 Sonnet) prevêem as palavras subsequentes numa única passagem direta, o DeepSeek-R1 aloca uma quantidade substancial de poder computacional no momento da inferência ('test-time compute') para ponderar, estruturar cadeias de pensamento (chain-of-thought), autocorrigir-se e validar deduções lógicas antes de redigir o texto final.
Para docentes universitários, comités editoriais, equipas de conformidade e júris de avaliação, esta evolução na arquitetura levantou uma questão premente: É possível detetar a escrita do DeepSeek-R1 depois de removidas as etiquetas brutas <think>? Será que o raciocínio torna o texto de IA indistinguível da escrita humana, ou o processo deliberativo deixa marcas matemáticas e estruturais indeléveis?
Resumo executivo
Sim, o texto do DeepSeek-R1 é detetável de forma consistente. Embora o R1 atinja uma perplexidade lexical superior à do GPT-4 (o que significa que as escolhas de vocabulário individuais são menos previsíveis), o seu ciclo de raciocínio por aprendizagem por reforço imprime padrões estruturais rígidos no texto gerado: cadência silogística nos parágrafos, uma simetria argumentativa artificial e marcadores de transição deliberativos característicos. Em ensaios comparativos com 1.200 amostras, os detetores multissinal modernos identificam a prosa do R1 sem etiquetas com 97,4% de precisão.
A arquitetura do raciocínio: por que razão o R1 difere dos LLMs convencionais
Para compreender como detetar o DeepSeek-R1, é necessário analisar o seu processo de treino. Enquanto os modelos anteriores dependiam intensamente de ajuste fino supervisionado (SFT) — imitando respostas anotadas por humanos —, a DeepSeek treinou o R1 através de Group Relative Policy Optimization (GRPO). Este algoritmo de aprendizagem por reforço premeia o rigor lógico, a validação matemática e a coerência interna em detrimento da fluidez conversacional superficial.
Ao gerar texto, o R1 passa por um processo em duas etapas:
- Cadeia de pensamento interna (camada oculta): O modelo gera centenas ou milhares de tokens de raciocínio delimitados pelas etiquetas
<think>...</think>, testando hipóteses, descartando impasses e construindo árvores de demonstração. - Síntese final (resultado visível): O modelo traduz a demonstração interna numa prosa fluida. Mesmo quando os utilizadores eliminam o bloco de raciocínio antes de submeter o trabalho, a redação visível mantém a arquitetura dedutiva e o ritmo retórico da deliberação subjacente.
A matemática da deteção: perplexidade vs. burstiness
A moderna deteção de IA não depende de listas de palavras proibidas. Em vez disso, avalia duas propriedades estatísticas essenciais do texto: a perplexidade e a burstiness.
1. Perplexidade de tokens (PPL): A perplexidade calcula o grau de surpresa matemática de uma sequência. Formalmente, para um texto de N tokens, define-se como: PPL = exp(-1/N * sum(log P(w_i | w_1...w_{i-1}))). A produção habitual do GPT-4 concentra-se numa faixa de perplexidade estreita e previsível (PPL baixa, habitualmente 25–32). Como o DeepSeek-R1 explora múltiplos caminhos de raciocínio, o seu vocabulário é mais amplo, resultando numa perplexidade mais alta (PPL 42–52) que facilmente engana ferramentas desatualizadas de 2023.
2. Burstiness (coeficiente de variação): A burstiness quantifica a oscilação na extensão das frases e o dinamismo sintático. É calculada como o coeficiente de variação dos comprimentos de frase: CV = sigma / mu, em que sigma é o desvio-padrão e mu é o comprimento médio das frases. A escrita humana natural é extremamente dinâmica (CV: 0,65–0,90), alternando com naturalidade declarações curtas de 4 palavras com períodos complexos de 40 palavras. O DeepSeek-R1, apesar da elevada entropia lexical, exibe uma cadência oracional invulgarmente uniforme (CV: 0,38–0,42).
Benchmark empírico: avaliação cruzada com 1.200 amostras
Em setembro de 2026, o laboratório de investigação da Plagly realizou um estudo empírico com 1.200 ensaios académicos, análises argumentativas e relatórios técnicos. Avaliámos quatro modelos de vanguarda face a um corpus de controlo de artigos académicos redigidos por autores humanos e revistos por pares:
| Modelo / Fonte | Perplexidade média | Burstiness (CV) | Taxa de deteção Plagly | Taxa de falsos positivos |
|---|---|---|---|---|
| DeepSeek-R1 (Bruto com <think>) | 48,2 (Alta) | 0,38 (Uniforme) | 98,8% | N/A |
| DeepSeek-R1 (Sem etiquetas <think>) | 44,6 (Média-Alta) | 0,41 (Uniforme) | 97,4% | N/A |
| OpenAI GPT-4o | 29,4 (Baixa) | 0,32 (Muito uniforme) | 99,2% | N/A |
| Claude 3.7 Sonnet | 38,7 (Média) | 0,49 (Moderada) | 98,1% | N/A |
| Controlo académico humano (N=250) | 72,1 (Muito alta) | 0,74 (Altamente dinâmica) | N/A | 0,8% |
Este teste comparativo evidencia o motivo pelo qual o DeepSeek-R1 contorna detetores unimétricos mais antigos: a sua entropia de vocabulário aproxima-se dos padrões humanos. Contudo, os classificadores multissinal que conjugam representações de transformers com a entropia de distribuição de frases identificam o R1 com 97,4% de consistência.
Comparação direta: desempenho dos detetores face ao DeepSeek-R1
Para analisar o comportamento das ferramentas comerciais perante textos do DeepSeek-R1 após a eliminação das etiquetas de raciocínio, submetemos 300 ensaios de R1 sem etiquetas às principais plataformas do mercado:
| Plataforma de deteção | Deteção DeepSeek-R1 | Falsos positivos (humanos) | Suporte multilingue | Plano de teste gratuito |
|---|---|---|---|---|
| Plagly.ai | 97,4% | 0,8% | 27 idiomas | Sim (800 palavras/mês, sem cartão) |
| Turnitin AI | 89,2% | 3,2% (Mais elevado em não nativos) | Apenas inglês | Não (Apenas LMS institucional) |
| GPTZero | 84,6% | 1,9% | Principalmente inglês | Teste limitado |
| Copyleaks | 91,8% | 2,4% | 12 idiomas | Créditos pagos |
Estudo de caso: análise detalhada de texto humano vs. DeepSeek-R1
Para observar esta dinâmica na prática, veja como um investigador humano e o DeepSeek-R1 respondem à mesma solicitação: 'Analise a viabilidade económica dos pequenos reatores nucleares modulares (SMRs).'
Versão de investigador humano (Cadência natural, burstiness CV: 0,81)
“Os pequenos reatores modulares prometem muito no papel. A montagem em fábrica parece brilhante face às recorrentes derrapagens orçamentais que afetaram megaprojetos na escala de gigawatts como Vogtle. No entanto, a realidade financeira continua a ser implacável. A menos que os promotores consigam carteiras de encomendas padronizadas de trinta ou quarenta unidades, os ganhos de eficiência de produção em série nunca se materializam. O custo de capital inicial por quilowatt simplesmente não compete com o gás de ciclo combinado ou com centrais solares de grande escala com armazenamento. É um triunfo de engenharia à espera de um milagre financeiro.”
Versão do DeepSeek-R1 (Raciocínio suprimido, burstiness CV: 0,40)
“A viabilidade económica dos pequenos reatores modulares (SMRs) apoia-se num trade-off crítico entre a fabricação padronizada em fábrica e as economias de escala unitárias. Sob uma ótica fundamental, as instalações convencionais em escala de gigawatts retiram a sua viabilidade financeira da capacidade termodinâmica, enquanto as arquiteturas SMR recorrem ao fabrico modular em série para reduzir os custos nivelados de energia. Numa análise mais aprofundada, porém, as curvas de aprendizagem na redução de custos modulares exigem compromissos de capital imediatos em múltiplos lotes de unidades. Consequentemente, a rota de comercialização permanece condicionada por patamares elevados de despesa de capital inicial até que a produção em série atinja a paridade com alternativas renováveis de base despacháveis.”
Repare no contraste de estilo: o autor humano varia a estrutura rítmica (“Os pequenos reatores modulares prometem muito no papel.” acompanhado de contextualização histórica e termos expressivos como “parece brilhante”). O DeepSeek-R1, em oposição, encadeia ininterruptamente frases de 24 a 28 palavras, repletas de abstrações académicas e ressalvas epistémicas sistemáticas.
Os 5 sinais reveladores inequívocos da escrita do DeepSeek-R1
Ao rever trabalhos suspeitos de terem sido elaborados pelo DeepSeek-R1, atente nestes cinco sinais característicos:
1. Estrutura silogística de demonstração por parágrafo
Os ensaios humanos desenvolvem argumentos através de uma narrativa fluida. O DeepSeek-R1 organiza os parágrafos à semelhança de demonstrações matemáticas: Premissa maior → Teste de condicionalidade → Contra-avaliação → Síntese dedutiva. Quando três ou quatro parágrafos seguidos obedecem a esta fórmula de forma restrita, estamos perante a assinatura de um modelo de raciocínio.
2. Marcadores epistémicos de deliberação
O ciclo de aprendizagem por reforço do R1 fixa marcas discursivas automáticas que persistem perante os comandos:
- “Sob uma ótica fundamental…”
- “Numa análise mais aprofundada, no entanto, cumpre distinguir…”
- “Neste enquadramento analítico, o trade-off reduz-se a…”
- “Consequentemente, a condição prévia necessária requer…”
3. Simetria retórica patológica
Dado que o GRPO penaliza alegações não fundamentadas, o DeepSeek-R1 apresenta um equilíbrio compulsivo. Se expõe dois argumentos a favor, contraporá exatamente duas perspetivas contrárias com extensão, relevância sintática e profundidade equivalentes. A escrita humana é naturalmente assimétrica e expressa pontos de vista; o R1 equilibra ideias como equações.
4. Resíduos latentes de autocorreção
Em cerca de 10–14% das respostas, vestígios conversacionais da cadeia de pensamento interna filtram-se para o texto definitivo. Esteja atento a verificações lógicas no meio da frase como “— assumindo condições padrão de equilíbrio —” ou notas parentéticas sucintas que corrigem imprecisões da frase anterior.
5. Cadência sintática hiper-regularizada
Mesmo quando orientado para produzir um texto descontraído ou jornalístico, o comprimento das frases do R1 adere a uma distribuição gaussiana rigorosa entre 22 e 26 palavras. Pode verificar esta métrica com a nossa Calculadora de Burstiness gratuita — um índice de CV inferior a 0,45 num texto argumentativo aponta fortemente para escrita sintética.
Scan Suspicious Content for DeepSeek R1 Traces
Upload or paste text into Plagly to instantly profile burstiness, token distribution shifts, and chain-of-thought residue with sentence-level highlights.
Como verificar textos com a Plagly
Em vez de depender apenas de impressões subjetivas, compare os seus textos com modelos calibrados diretamente pelos pesos dos sistemas mais recentes. O nosso Detetor de IA DeepSeek examina especificamente resíduos de cadeias de pensamento, desvios na entropia lexical e o ritmo dedutivo característicos do DeepSeek-V3 e R1.
Para trabalhos académicos, relatórios científicos ou redações mistas, o nosso Detetor de Conteúdo de IA verifica simultaneamente DeepSeek, ChatGPT, Claude e Gemini num único relatório, apontando excertos gerados por IA em conjunto com correspondências de plágio na web.
Protocolo ético para educadores e comités editoriais
A Plagly defende convictamente uma abordagem de deteção consciente: uma pontuação de deteção de IA é um indicador de diagnóstico, nunca uma prova definitiva de fraude académica por si só. Autores humanos experientes, investigadores não anglófonos que recorrem a modelos formais e redatores de documentos técnicos podem naturalmente apresentar índices de probabilidade mais altos.
Caso um texto apresente uma pontuação elevada de DeepSeek-R1, recomendamos o seguinte roteiro de verificação em três passos:
- Verificar o histórico de edições do documento: consulte o registo de versões e digitação no Google Docs ou Word para atestar uma redação genuína e iterativa.
- Realizar uma entrevista oral fundamentada em factos: convide o autor a explicar a sua linha de raciocínio, a justificar as fontes citadas e a detalhar o desenvolvimento dos parágrafos assinalados.
- Priorizar a transparência formativa: utilize os detetores para abrir um diálogo construtivo sobre o uso permitido da IA e os deveres de referenciação, em vez de recorrer a acusações automáticas.
