Tại sao cần đo lường AI writing trên arXiv?

arXiv là kho lưu trữ tiền ấn phẩm khoa học lớn nhất thế giới, nơi hàng chục nghìn bài báo được công bố mỗi tháng. Khi các mô hình ngôn ngữ lớn trở nên phổ biến, một câu hỏi kinh doanh và học thuật đặt ra: bao nhiêu phần trăm nội dung thực sự do máy tạo ra? Việc đo lường AI writing trên arXiv không chỉ là bài toán tò mò. Nó ảnh hưởng trực tiếp đến uy tín của quy trình bình duyệt, cách các tổ chức đánh giá năng lực nghiên cứu, và cách nhà đầu tư đọc tín hiệu chất lượng từ một lĩnh vực.
Với góc nhìn ra quyết định, con số phần trăm chỉ có giá trị khi bạn hiểu rõ nó được tạo ra như thế nào. Một AI detector đưa ra tỷ lệ 30% hay 40% nghe rất kêu, nhưng nếu công cụ đó cũng gắn cờ nhầm văn bản do con người viết, con số ấy vô nghĩa. Đây là lý do chúng ta cần một phương pháp đo lường có kỷ luật, có nhóm đối chứng, và có báo cáo giới hạn trung thực.
Vấn đề “sàn false-positive”: Con số bao nhiêu % mới đáng tin?

Có cả một dòng tiêu đề kiểu “N% của X giờ là AI”, và phần lớn không đáng đọc. Lý do rất đơn giản: công cụ đứng sau con số đó cũng gắn cờ một phần văn bản do con người viết thật. Giả sử một AI detector đánh dấu 40% bài báo mới là machine-written papers, nhưng đồng thời cũng đánh dấu 20% bài báo viết từ trước khi ChatGPT tồn tại. Câu chuyện thực sự nằm ở con số 20% mà không ai nhắc tới.
Đó chính là khái niệm false-positive rate — tỷ lệ dương tính giả. Nó là sàn. Mọi con số bạn báo cáo phải được đặt trên nền sàn này. Trong nghiên cứu tham chiếu, công cụ được hiệu chỉnh riêng cho văn phong học thuật: ở mức false-positive rate 0.4%, nó cho qua 99.6% văn bản khoa học do con người viết trước thời LLM và bắt được 85% văn bản học thuật do AI tạo. Nói cách khác, trước khi tin vào bất kỳ tỷ lệ nào về AI, hãy hỏi: sàn dương tính giả là bao nhiêu, và đã ai neo con số vào đó chưa?
Phương pháp đo lường: Hiệu chỉnh ngưỡng và nhóm đối chứng trước ChatGPT

Nguyên tắc cốt lõi khi đánh giá nội dung do AI tạo là biến điểm yếu tiềm tàng thành điểm neo. Cách làm: lấy các bài nộp năm 2021 và 2022, tức trước khi ChatGPT ra mắt, coi chúng là “sự thật nền” do con người viết, rồi đặt ngưỡng gắn cờ sao cho đúng 0.4% trong số đó bị kích hoạt. Đường 0.4% đó là sàn. Mọi con số báo cáo sau này đều là tỷ lệ bài vượt ngưỡng, mà tại ngưỡng đó văn bản trước thời LLM — theo thiết kế — chỉ chạm 0.4%.
Cái hay của thiết kế này là những năm trước ChatGPT trở thành nhóm đối chứng cài sẵn. Nếu đà tăng chỉ là ảo giác do công cụ tạo ra, thì 2021 và 2022 lẽ ra phải bị gắn cờ cao ngang 2026. Dữ liệu cho thấy điều ngược lại: tỷ lệ giữ phẳng ở 0.4% suốt hai năm đối chứng. Với một doanh nhân quen đọc báo cáo tài chính, đây giống như có một baseline sạch để so sánh mọi biến động — không có nó, mọi kết luận đều thiếu cơ sở.
Cách lấy mẫu và chấm điểm: Full-text vs. Abstract, dữ liệu version-1
Chi tiết lấy mẫu quyết định độ tin cậy. Nghiên cứu lấy mười nhóm lĩnh vực, khoảng 25 bài mỗi lĩnh vực mỗi tháng, từ tháng 1/2023 đến tháng 7/2026, cộng thêm tám tháng đối chứng rải trong 2021 và 2022 — tổng cộng 12.750 bài. Với mỗi bài, họ lấy bản PDF phiên bản đầu tiên (version-1), để một bài chỉnh sửa năm 2026 không thể rò rỉ văn bản hiện đại ngược về vị trí năm 2023 của nó.
Một quyết định phương pháp đáng chú ý: chấm toàn văn thay vì chỉ chấm abstract. Abstract làm giảm tín hiệu. Cùng một bài có thể đạt dưới 20% khi chấm phần tóm tắt nhưng vượt 70% khi chấm phần thân. Nếu bạn muốn đánh giá tỷ lệ nội dung do máy tạo một cách nghiêm túc, chấm full-text là lựa chọn cho tín hiệu trung thực hơn. Mỗi con số báo cáo đều kèm khoảng tin cậy 95% bằng bootstrap, để người đọc biết biên độ dao động thay vì tin vào một điểm số trần trụi.
Kết quả theo lĩnh vực: Từ Khoa học máy tính đến Toán học
Tỷ lệ gắn cờ giữ phẳng ở 0.4% suốt 2021 và 2022, bật lên chỉ vài tháng sau khi ChatGPT xuất hiện, rồi leo theo hai đợt sóng lên khoảng 32% trong quý gần nhất hoàn chỉnh, đỉnh gần 39% vào đầu 2026. Nhưng con số tổng hợp che giấu sự phân hóa lớn giữa các lĩnh vực:
- Khoa học máy tính dẫn đầu, khoảng 65% bài bị gắn cờ là machine-written papers.
- Toán học thấp nhất, gần 0.7% — một con số cần diễn giải thận trọng.
- Các lĩnh vực tăng mạnh nhất không phải là các lĩnh vực có mức đối chứng trước thời LLM cao nhất, nên một điểm xuất phát cao không giải thích được đà tăng.
Cột đối chứng của mỗi lĩnh vực là tỷ lệ gắn cờ giai đoạn 2021–2022, tính trung bình qua ba mức nhạy. Đây là tín hiệu quan trọng: đà tăng là thật, không phải sản phẩm của một ngưỡng cài đặt sai.
Giới hạn của phương pháp và cách diễn giải kết quả đúng

Trung thực về giới hạn là điều tách một báo cáo đáng tin khỏi một tiêu đề giật gân. Có bốn giới hạn cần nêu rõ:
- Cỡ mẫu đối chứng. Mỗi lĩnh vực chỉ có 200 bài đối chứng trước ChatGPT. Ở tỷ lệ 0.4%, chỉ khoảng tám bài bị gắn cờ trên toàn bộ 2.000 bài đối chứng, rải mỏng qua mười lĩnh vực. Sàn gộp thì ước lượng tốt, nhưng mức đối chứng từng lĩnh vực chỉ mang tính gần đúng.
- Điểm thấp có thể do ít áp dụng, hoặc do điểm mù của công cụ. Toán học là ví dụ rõ nhất: văn bản dày ký hiệu và cấu trúc định lý–chứng minh, phần văn xuôi còn lại thưa và khác xa tiếng Anh khoa học mà AI detector được huấn luyện. Một bài toán soạn với trợ giúp AI nặng vẫn có thể đạt điểm thấp vì văn phong nằm ngoài phân phối. Vì vậy điểm thấp ở Toán học là bằng chứng yếu cho việc con người viết.
- Độ phủ của công cụ. Công cụ nhạy hơn với một số trình tạo văn bản so với số khác. Độ phủ chưa đầy đủ kéo tỷ lệ xuống, nên con số báo cáo là cận dưới — tỷ lệ thật ít nhất bằng con số đo được.
- Gắn cờ không phải là quy kết tác giả. Công cụ ước lượng xác suất một đoạn văn “đọc như do máy viết”, với sai số đã biết. Nó không tách được một tài liệu chỉnh sửa nhẹ khỏi một tài liệu tạo hoàn toàn, và một điểm số đơn lẻ không bao giờ là căn cứ để buộc tội một cá nhân cụ thể.
Công cụ và quy trình thực hành để tự kiểm chứng
Nếu bạn muốn tự kiểm chứng thay vì tin vào tiêu đề, quy trình thực hành khá gọn:
- Xác định sàn trước. Chọn một tập văn bản chắc chắn do con người viết (ví dụ bài trước 2023) và đặt ngưỡng để cố định false-positive rate ở mức bạn chấp nhận, chẳng hạn 0.4%.
- Chấm toàn văn. Ưu tiên phần thân bài thay vì abstract để không làm loãng tín hiệu.
- Dùng version-1. Lấy phiên bản đầu tiên để tránh rò rỉ văn bản chỉnh sửa về sau.
- Báo cáo khoảng tin cậy. Luôn kèm biên độ, đừng chỉ nêu một điểm số.
- Diễn giải theo lĩnh vực. Coi điểm thấp ở các lĩnh vực dày ký hiệu là cận dưới của mức áp dụng, không phải bằng chứng vắng mặt AI.
Công cụ đo trong nghiên cứu tham chiếu rẻ để chạy và cho phép kiểm tra bất kỳ bài arXiv nào cũng như văn bản của chính bạn. Với người ra quyết định, giá trị nằm ở chỗ bạn có thể tái lập được con số, chứ không phải chỉ trích dẫn nó.
Câu hỏi thường gặp (FAQ)
Tỷ lệ false-positive 0.4% có ý nghĩa gì và tại sao lại quan trọng?
Tỷ lệ 0.4% nghĩa là trong số văn bản chắc chắn do con người viết, chỉ 0.4% bị gắn cờ nhầm. Đây là sàn để so sánh. Khi bạn cố định false-positive rate ở mức thấp và ổn định, mọi tỷ lệ vượt ngưỡng sau đó đều được đọc trên cùng một nền. Nếu không neo vào sàn này, một con số như “40% là AI” hoàn toàn có thể chỉ phản ánh việc công cụ gắn cờ bừa. Nó quan trọng vì nó biến một con số marketing thành một con số có kỷ luật.
Vì sao điểm số của bài Toán học thấp không đồng nghĩa là do con người viết?
Vì bài Toán học chủ yếu là ký hiệu, công thức và cấu trúc định lý–chứng minh. Sau khi loại bỏ phương trình và tài liệu tham khảo, phần văn xuôi còn lại quá thưa và khác xa với dữ liệu mà AI detector được huấn luyện. Một bài toán soạn với trợ giúp AI nặng vẫn có thể đạt điểm thấp đơn giản vì văn phong của nó nằm ngoài phân phối của công cụ. Do đó, điểm thấp ở Toán học nên được đọc là cận dưới của mức áp dụng, không phải bằng chứng rằng con người đã viết toàn bộ.
Nên chấm điểm toàn văn hay chỉ chấm abstract khi đánh giá nội dung AI?
Nên chấm toàn văn. Abstract làm giảm tín hiệu đáng kể: cùng một bài có thể đạt dưới 20% ở abstract nhưng vượt 70% ở phần thân. Nếu mục tiêu là đánh giá tỷ lệ nội dung do máy tạo một cách chính xác, chấm full-text cho bức tranh trung thực hơn nhiều so với chỉ đọc vài trăm chữ tóm tắt.
Kết luận
Việc đo lường AI writing trên arXiv chỉ có giá trị khi con số được đặt trên một sàn dương tính giả rõ ràng, có nhóm đối chứng trước ChatGPT, và đi kèm báo cáo giới hạn trung thực. Kết quả tham chiếu cho thấy tỷ lệ machine-written papers tăng từ mức nền 0.4% lên khoảng một phần ba trong quý gần nhất — một tín hiệu thật, không phải ảo giác của công cụ. Với người ra quyết định, bài học rút ra không phải là con số cụ thể, mà là phương pháp: hãy hỏi về false-positive rate, cách lấy mẫu, và cách diễn giải trước khi tin vào bất kỳ tiêu đề nào về AI trong nghiên cứu khoa học.
