Truyền thông

AI xếp hạng nghiên cứu: Bước tiến hay cuộc đua mới?

Xuân Bình 12/08/2026 07:51

Một công cụ AI đang thử xếp hạng nghiên cứu dựa trên chất lượng và tính mới. Cách làm này mở ra cơ hội, nhưng cũng đặt ra không ít tranh luận.

AI có thể chọn ra 1% công trình khoa học tốt nhất?

Ngày càng nhiều công cụ AI được phát triển để hỗ trợ các nhà nghiên cứu kiểm tra bản thảo trước khi công bố. Trong số đó, QED Science, một công ty khởi nghiệp (start-up) tại Tel Aviv (Israel) đã gây chú ý với hệ thống AI có khả năng đánh giá các nghiên cứu trong lĩnh vực khoa học sự sống dựa trên mức độ mới và tính hợp lệ của các kết luận.

450-202608111041591.png
AI của QED Science đánh giá hơn 57.000 bản thảo trên bioRxiv để lựa chọn 1% công trình có điểm số cao nhất. (Nguồn: iStock/JDawnInk).

Công cụ này được thiết kế để kiểm tra liệu các tuyên bố trong một bản thảo có thực sự được dữ liệu hỗ trợ hay không, đồng thời phát hiện những điểm còn thiếu hoặc chưa đủ bằng chứng. Theo QED Science, hệ thống hiện được hơn 10.000 phòng thí nghiệm tại 1.500 tổ chức ở hơn 70 quốc gia sử dụng miễn phí.

Tháng 11/2025, openRxiv, tổ chức phi lợi nhuận vận hành hai kho bản thảo bioRxiv và medRxiv, thông báo thử nghiệm công cụ này trên bioRxiv.

Đến tháng 6/2026, QED Science công bố kết quả phân tích hơn 57.000 bản thảo được đăng trên bioRxiv trong giai đoạn từ tháng 5/2025 đến tháng 4/2026. Hệ thống đã lựa chọn ra 574 công trình, tương đương 1%, có điểm số cao nhất.

AI đánh giá nghiên cứu như thế nào?

Trả lời Nature, Niv Mastboim, đồng sáng lập kiêm CEO QED Science, cho biết điểm khác biệt của hệ thống nằm ở việc AI không chỉ học từ những nghiên cứu có kết quả tích cực.

Theo ông, phần lớn tài liệu khoa học được công bố có xu hướng thiên về các kết quả thành công và ủng hộ giả thuyết ban đầu. Vì vậy, để đánh giá một tuyên bố khoa học, AI cũng cần hiểu thế nào là bằng chứng không ủng hộ tuyên bố đó.

QED Science đưa vào hệ thống nhiều nguồn dữ liệu, bao gồm các bài phản biện công khai, phản hồi của người dùng và dữ liệu tổng hợp. Công cụ cũng được huấn luyện để nhận diện các kết quả âm tính, những nghiên cứu không tái lập được kết quả trước đó hoặc các bằng chứng mâu thuẫn với giả thuyết.

Mỗi tuyên bố trong một bài nghiên cứu được hệ thống đánh giá và gắn điểm, dựa trên nhiều tiêu chí như tính mới và tính hợp lệ. Phản hồi từ người dùng tiếp tục được sử dụng để điều chỉnh hệ thống.

Mastboim cho rằng, cách tiếp cận này nhằm giúp các nhà nghiên cứu phát hiện những điểm yếu trong công trình trước khi đưa kết quả ra công chúng.

Công nghệ có thực sự công bằng hơn con người?

Một trong những mục tiêu của danh sách "top 1%" là đánh giá nghiên cứu dựa trên chính nội dung công trình, thay vì danh tiếng của tác giả, trường đại học hay tạp chí đăng bài.

Theo QED Science, 574 bản thảo được lựa chọn hoàn toàn dựa trên điểm đánh giá về tính mới và tính hợp lệ, không xét đến danh tính tác giả, tổ chức hay nơi công bố.

Công ty cũng thực hiện một phân tích riêng trên 2.879 bản thảo bioRxiv đăng hồi tháng 4/2025 và sau đó được xuất bản trên các tạp chí có phản biện. Kết quả cho thấy, AI của QED Science đánh giá 12,9% số bài này cao hơn mức có thể dự đoán từ thứ hạng của tạp chí nơi được xuất bản.

QED Science gọi những công trình như vậy là "hidden gems" - những nghiên cứu có chất lượng nhưng có thể chưa được hệ thống xuất bản hiện tại chú ý đúng mức. Trong một đánh giá tiếp theo với sự tham gia của các chuyên gia, nhóm nghiên cứu cho biết các chuyên gia ưu tiên bài được QED đánh giá cao hơn trong 75% số trường hợp có sự khác biệt rõ ràng.

Tuy nhiên, chính việc tạo ra một bảng xếp hạng "1% công trình tốt nhất" lại khiến công cụ này vấp phải tranh luận.

Một số nhà nghiên cứu lo ngại danh sách có thể trở thành một dạng "nhãn uy tín" mới, qua đó củng cố văn hóa chạy theo chỉ số vốn đã phổ biến trong học thuật. Nếu một hệ thống AI có thể gắn nhãn một số công trình là tinh hoa, các nhà nghiên cứu có thể tiếp tục chịu áp lực phải đạt thứ hạng cao thay vì tập trung vào giá trị khoa học thực chất.

AI có thể trở thành "người phản biện" khoa học?

Mastboim khẳng định, QED Science không hướng tới việc thay thế phản biện khoa học hay trở thành công cụ cho các nhà xuất bản. Mục tiêu của công ty là cung cấp cho tác giả một công cụ miễn phí để kiểm tra và cải thiện nghiên cứu trước khi công bố.

CEO QED Science nhấn mạnh, AI không thay thế khả năng phán đoán của nhà nghiên cứu mà hỗ trợ họ nhận ra những vấn đề có thể bị bỏ sót.

Điều này cũng giải thích vì sao QED Science không cho rằng 99% công trình còn lại trong bảng xếp hạng là những nghiên cứu kém giá trị. Việc một bài không lọt vào nhóm 1% chỉ phản ánh điểm số tương đối của bài đó trong một tập dữ liệu cụ thể.

"Không có nghĩa là không có khoa học tuyệt vời ở nhóm 98% hay 97,5%", Mastboim nói.

QED Science dự định phát triển thêm nhiều hệ thống điểm số theo các tiêu chí khác nhau, thay vì chỉ đưa ra một thứ hạng tổng hợp.

450-202608111041592.jpg
AI có thể đánh giá nghiên cứu, nhưng tạp chí uy tín vẫn giữ vai trò quan trọng. (Nguồn: VJST).

Khi AI bắt đầu chấm điểm khoa học

Sự xuất hiện của những công cụ như QED Science cho thấy, AI đang tiến thêm một bước trong quy trình nghiên cứu: từ hỗ trợ viết và phân tích dữ liệu sang đánh giá chất lượng của chính các công trình khoa học.

Điều này có thể giúp nhà nghiên cứu phát hiện điểm yếu trước khi công bố, đặc biệt khi một công cụ có thể nhanh chóng kiểm tra hàng nghìn tuyên bố và đối chiếu chúng với nhiều dạng bằng chứng.

Nhưng câu hỏi lớn hơn vẫn còn bỏ ngỏ: AI có thực sự đủ đáng tin để đánh giá chất lượng khoa học, và ai sẽ chịu trách nhiệm khi AI đánh giá sai?

Ngay cả khi công cụ không được thiết kế để thay thế phản biện đồng cấp, một bảng xếp hạng AI được sử dụng rộng rãi vẫn có thể tác động đến cách nghiên cứu được nhìn nhận. Khi đó, vấn đề không còn đơn thuần là AI có thể "đọc" bao nhiêu bài báo, mà là cộng đồng khoa học sẽ trao cho những điểm số do AI tạo ra bao nhiêu quyền lực.

Với QED Science, mục tiêu hiện tại là giúp nhà nghiên cứu nhìn thấy những điểm yếu mà họ có thể bỏ qua. Nhưng việc AI có trở thành một "người gác cổng" mới của khoa học hay không sẽ phụ thuộc vào cách các nhà nghiên cứu, tổ chức và hệ thống xuất bản sử dụng những đánh giá này như thế nào./.

Xuân Bình