Tính đến tháng 5 năm 2026, ba mô hình AI tiên tiến đang thống trị việc viết lách chuyên nghiệp và học thuật: GPT-5.5 của OpenAI, Claude 4.6 của Anthropic và Gemini 3.1 của Google. Mỗi mô hình đều đi kèm với những lời quảng cáo về việc đầu ra của chúng mang lại cảm giác “người” như thế nào. Mỗi mô hình được sử dụng hàng triệu lần mỗi ngày cho các loại văn bản như luận văn, báo cáo và thư viện nội dung. Và mỗi mô hình đều để lại một “dấu vân tay” thống kê khác nhau mà các công cụ phát hiện có thể — hoặc đôi khi không thể — bắt được.
Chúng tôi đã chạy 600 mẫu mới trên cả ba mô hình và đưa mỗi mẫu qua cùng một trình phát hiện tập hợp đa mô hình (multi-model ensemble detector). Kết quả đã đảo ngược một số giả định phổ biến về việc mô hình nào khó phát hiện nhất — và làm rõ lý do tại sao câu trả lời vào năm 2026 lại quan trọng hơn bất kỳ năm nào trước đó.
Cách chúng tôi thử nghiệm
Chúng tôi đã tạo ra 200 kết quả đầu ra cho mỗi mô hình — mỗi loại 50 mẫu bao gồm luận văn học thuật, nội dung tiếp thị, giải thích kỹ thuật và truyện hư cấu sáng tạo. Mỗi lần tạo đều sử dụng câu lệnh hệ thống mặc định và không có hướng dẫn để trốn tránh sự phát hiện. Sau đó, chúng tôi tạo ra các biến thể đối kháng cho mỗi mẫu: một phiên bản được xử lý qua công cụ “nhân hóa” (humanizer) và một phiên bản được chỉnh sửa nhẹ (15–20% từ ngữ được viết lại thủ công). Tổng cộng: 600 mẫu cơ sở, 1.200 mẫu đối kháng.
Mọi mẫu đều được đánh giá bởi Hội đồng Agentic của Plagly.ai (perplexity, burstiness, stylometry, fingerprint, discourse) và được kiểm tra chéo với bộ phân loại mới nhất từ một trình phát hiện đơn mô hình thương mại lớn. Kết quả dưới đây báo cáo tỷ lệ phát hiện của Plagly.
Kết quả chính: Đầu ra nguyên bản
Đối với các đầu ra mặc định không có sự chỉnh sửa đối kháng, cả ba mô hình đều tập trung khá gần nhau — nhưng những khác biệt nhỏ lại mang tính tiết lộ.
Độ chính xác phát hiện trên đầu ra nguyên bản
GPT-5.5 (nguyên bản): 94% bị phát hiện. Claude 4.6 (nguyên bản): 88% bị phát hiện. Gemini 3.1 (nguyên bản): 92% bị phát hiện. Trên các đầu ra mặc định không có câu lệnh đối kháng, cả ba đều được phát hiện một cách đáng tin cậy bởi các công cụ tập hợp — nhưng khoảng cách giữa Claude 4.6 và các mô hình khác là có thật.
Tại sao Claude 4.6 dẫn đầu về khả năng tàng hình
Claude 4.6 được huấn luyện với trọng tâm mạnh mẽ vào sự biến đổi sắc thái và nhịp điệu văn xuôi giống con người. Mô hình này thay đổi cấu trúc câu mạnh mẽ hơn các đối thủ, sử dụng ít các từ nối mang tính công thức hơn và thể hiện sự cam kết chân thực hơn đối với một lập trường trong các bài viết nghị luận. Kết quả là văn bản đạt điểm gần với văn xuôi của con người hơn trên các trục perplexity và burstiness mà các trình phát hiện đơn mô hình thường nhấn mạnh.
Tại sao GPT-5.5 là dễ nhận ra nhất
Mặc dù được tối ưu hóa mạnh mẽ nhất về sự trôi chảy, GPT-5.5 vẫn giữ lại các mẫu cấu trúc từ trên xuống mạnh nhất trong số ba mô hình. Quá trình huấn luyện của nó nhấn mạnh vào tính tin cậy và sự cân bằng, điều này tạo ra một hình thái lập luận dễ nhận biết: giới thiệu, trình bày nhiều góc nhìn, kết thúc bằng một sự tổng hợp có chừng mực. Các trình phát hiện mô hình hóa diễn ngôn ở cấp độ đoạn văn và tài liệu sẽ nhận ra điều này một cách nhất quán, ngay cả khi các đặc điểm bề mặt cấp độ câu vượt qua được kiểm tra.
Sự khác biệt giữa các mô hình: Phân tích theo tính năng
Các con số chính về độ chính xác che giấu những khác biệt lớn hơn về việc tính năng nào kích hoạt sự phát hiện. Việc xem xét điểm số của từng bộ phân loại sẽ kể một câu chuyện hữu ích hơn.
Tín hiệu diễn ngôn (Discourse)
GPT-5.5 có dấu vân tay diễn ngôn mạnh nhất trong số ba mô hình. Sự ưu tiên của nó cho các lập luận cân bằng, việc sử dụng quá mức một số cụm từ chuyển tiếp và xu hướng tóm tắt trước khiến nó trở thành mô hình dễ nhận ra nhất ở cấp độ đoạn văn — ngay cả khi các câu riêng lẻ vượt qua được các trình phát hiện đơn mô hình.
Tín hiệu phong cách (Stylometric)
Gemini 3.1 dẫn đầu về các dấu hiệu phong cách. Đầu ra của nó cho thấy các mẫu đặc trưng về tần suất trạng từ, cấu trúc câu bị động và nhịp điệu cấp độ mệnh đề. Những đặc điểm này được nhúng sâu vào cách dữ liệu huấn luyện của Google được tuyển chọn và đã được chứng minh là khó để mô hình tự triệt tiêu mà không làm mất đi sự trôi chảy.
Tín hiệu Perplexity
Claude 4.6 có cấu hình perplexity sạch nhất — đầu ra của nó nằm gần nhất với các mẫu do con người viết. Đây là điều khiến nó khó bị bắt nhất bởi các trình phát hiện perplexity đơn mô hình. Nhưng Claude 4.6 vẫn có các đặc điểm dấu vân tay và diễn ngôn có thể đo lường được, đó là lý do tại sao các trình phát hiện tập hợp duy trì độ chính xác đối với nó trong khi các công cụ đơn giản hơn thất bại.
Thử nghiệm cả ba mô hình với trình tập hợp của Plagly
Dán đầu ra của GPT-5.5, Claude 4.6 hoặc Gemini 3.1 vào trình phát hiện AI miễn phí của Plagly.ai. Xem phân tích theo từng mô hình — perplexity, burstiness, stylometry, fingerprint, discourse — và tín hiệu nào đã kích hoạt điểm số.
Thử Plagly miễn phíĐiều kiện đối kháng: Khi mọi thứ trở nên khó khăn hơn
Khoảng cách lớn hơn giữa các mô hình xuất hiện trong các điều kiện đối kháng. Sau khi chạy đầu ra của từng mô hình qua một công cụ nhân hóa, chúng tôi đã kiểm tra lại:
- GPT-5.5 + nhân hóa: 72% bị phát hiện.
- Claude 4.6 + nhân hóa: 64% bị phát hiện.
- Gemini 3.1 + nhân hóa: 70% bị phát hiện.
Lợi thế dẫn đầu của Claude 4.6 trong điều kiện nguyên bản càng nới rộng hơn khi có sự xuất hiện của công cụ nhân hóa — nhưng ngay cả ở cài đặt đối kháng mạnh nhất, phần lớn đầu ra của Claude 4.6 vẫn bị gắn cờ. Quan niệm rằng bất kỳ mô hình nào trong số này có thể trốn tránh các trình phát hiện tập hợp hiện đại một cách đáng tin cậy là không phù hợp với dữ liệu thực tế.
Tại sao điều này lại quan trọng vào năm 2026
Cuộc chiến mô hình đã tăng tốc xuyên suốt cuối năm 2025 và năm 2026, với việc OpenAI ra mắt GPT-5.5 nhằm vượt qua lợi thế tàng hình của Claude, Anthropic đáp trả bằng những cải tiến về nhịp điệu văn xuôi của Claude 4.6, và Google thúc đẩy Gemini 3.1 để thu hẹp khoảng cách về sự trôi chảy. Từ góc độ phát hiện, các hệ quả thực tế đang hội tụ lại.
Các trình phát hiện đơn mô hình ngày càng không đáng tin cậy
Trên cả ba mô hình, các trình phát hiện đơn bộ phân loại là dễ bị tổn thương nhất. Một công cụ chỉ dựa trên perplexity vốn hoạt động tốt trên GPT-3.5 giờ đây phân loại sai đầu ra của Claude 4.6 khoảng 50–60% thời gian. Một công cụ chỉ dựa trên burstiness cũng thất bại tương tự. Các trình tập hợp đa mô hình duy trì độ chính xác vì không có một mô hình đơn lẻ nào phải thực hiện toàn bộ công việc.
Việc tái huấn luyện liên tục quan trọng hơn bất kỳ thuật toán đơn lẻ nào
Hội đồng Agentic của Plagly.ai tái huấn luyện mô-đun dấu vân tay của mình liên tục trên các đầu ra mới nhất từ mỗi mô hình tiên tiến lớn. Độ chính xác phát hiện trên Claude 4.6 đã tăng khoảng sáu điểm phần trăm kể từ khi ra mắt do các mẫu phong cách của mô hình được đại diện tốt hơn trong dữ liệu huấn luyện — một mô hình được lặp lại với mỗi lần phát hành mô hình mới.
Điều gì tiếp theo: Claude 5, GPT-6, Gemini 4
Cả ba phòng thí nghiệm đều đã công khai báo hiệu việc phát hành thế hệ tiếp theo xuyên suốt năm 2026 và sang năm 2027. Dựa trên chu kỳ GPT-5.5/Claude 4.6/Gemini 3.1, đây là những gì có thể mong đợi: một đợt sụt giảm độ chính xác phát hiện tạm thời khác trên tất cả các công cụ ở mỗi lần phát hành lớn, sự phục hồi nhanh hơn cho các sản phẩm tập hợp, và khoảng cách tiếp tục nới rộng giữa các trình phát hiện đa mô hình hiện đại và các sản phẩm đơn bộ phân loại kế thừa.
Cuộc chạy đua vũ trang dài hạn đang hơi nghiêng về phía phát hiện. Mỗi thế hệ LLM đều giảm bớt các dấu hiệu phong cách bề mặt nhưng không thể dễ dàng loại bỏ các mẫu cấu trúc sâu hơn đến từ việc được huấn luyện như một bộ dự đoán mã thông báo tiếp theo trên dữ liệu quy mô internet. Những mẫu đó là thứ mà các trình phát hiện được thiết kế tốt học cách đọc, và đó là lớp tồn tại qua các lần cập nhật mô hình.
Chạy một cuộc so găng mô hình thực tế
Bạn có đầu ra từ GPT-5.5, Claude 4.6 hoặc Gemini 3.1? Trình phát hiện miễn phí của Plagly sẽ phân tích những tín hiệu mà mỗi mô hình kích hoạt — và cho bạn thấy tại sao cùng một nội dung lại được đọc khác nhau bởi các công cụ tập hợp so với các công cụ đơn mô hình.
Chạy thử nghiệm phát hiện miễn phíĐiểm mấu chốt
Claude 4.6 hiện là mô hình khó phát hiện nhất trong số ba mô hình tiên tiến — nhưng chỉ hơn vài điểm phần trăm, và chỉ khi được đo lường so với các trình phát hiện đơn mô hình. Các trình tập hợp đa mô hình vẫn gắn cờ phần lớn đầu ra của cả ba mô hình, và khoảng cách sẽ còn thu hẹp hơn nữa sau mỗi vòng tái huấn luyện trình phát hiện. Câu hỏi đúng cho năm 2026 không phải là “tôi có thể sử dụng mô hình nào để trốn tránh sự phát hiện?” mà là “tôi có thể tin tưởng trình phát hiện nào để cho tôi một kết quả chính xác?” Câu trả lời cho câu hỏi đó — tập hợp, đa mô hình, được tái huấn luyện liên tục — chưa bao giờ rõ ràng hơn thế.
