Giáo sư toán học Marc Lackenby của Đại học Oxford giao một bài toán mở cho AI Co-Mathematician của Google, hệ thống tạo ra một chứng minh rồi chính agent kiểm duyệt của nó bác bỏ chứng minh đó, và Lackenby đọc lập luận bị bác bỏ, phát hiện một chiến lược thực sự mới bên trong, tự vá lỗ hổng và giải quyết được bài toán.
Tóm tắt các điểm chính
- AI Co-Mathematician đạt 48% trên FrontierMath Tier 4, benchmark cấp nghiên cứu, điểm số cao nhất từng được ghi nhận, vượt xa mức 19% mà chính Gemini 3.1 Pro đạt được trên cùng bài kiểm tra, cùng tier.
- Trên một benchmark nội bộ của Google gồm 100 bài toán toán học cấp nghiên cứu chưa từng rò rỉ, có đáp án kiểm tra được bằng code, AI Co-Mathematician đạt 87%, trong khi Gemini 3.1 Pro đạt 57% và Gemini 3.1 Deep Think đạt 70%.
- Hệ thống được công bố qua một preprint arXiv tháng 5/2026 của Google DeepMind, hiện đang phát hành giới hạn cho một nhóm nhà nghiên cứu được chọn.
- AI Co-Mathematician được xây trên nền Gemini 3.1, hiện dùng Gemini Deep Think nội bộ cho các lần thử chứng minh, chưa tích hợp các engine toán học chuyên biệt của DeepMind như AlphaProof, AlphaEvolve, Aletheia.
- Đây là năm bận rộn cho AI và toán học: tháng 7/2026, Claude Fable 5 giúp thu hẹp giả thuyết Jacobian, GPT-5.6 Sol đề xuất construction phá vỡ giả thuyết Maxwell và giúp giải quyết giả thuyết Dinitz-Garg-Goemans, còn Astra chưa phát hành của OpenAI giải quyết 10 bài toán mở trong một ngày.
AI Co-Mathematician của Google DeepMind là gì?
AI Co-Mathematician là một workbench nghiên cứu của Google DeepMind, điều phối một nhóm agent AI chuyên biệt để giúp nhà toán học vận hành toàn bộ một dự án nghiên cứu, từ đặt câu hỏi cho đến khi hoàn thành một chứng minh viết sẵn. Hệ thống được thiết kế để điều phối toàn bộ quy trình nghiên cứu lộn xộn, phi tuyến tính, chứ không phải để trả lời một câu hỏi duy nhất trong một lượt.
Tháng 5/2026, các nhà nghiên cứu Google DeepMind công bố một preprint arXiv có tiêu đề “AI co-mathematician: Accelerating mathematicians with agentic AI”, mô tả một workbench AI agentic điều phối toàn bộ chu trình làm việc toán học, gồm nảy ý tưởng, tìm kiếm tài liệu, tính toán, thử chứng minh và xây dựng lý thuyết.
AI Co-Mathematician hiện đang phát hành giới hạn cho một nhóm nhà nghiên cứu được chọn, bản thân nó không phải một công cụ giải bài toán hay một chatbot, mà là một không gian làm việc có trạng thái (stateful workspace) điều phối quy trình toán học phi tuyến tính, lộn xộn. Hệ thống quản lý nhiều luồng nghiên cứu song song, theo dõi mức độ không chắc chắn, và lưu giữ các lần thử thất bại để tham khảo về sau. Output ở định dạng LaTeX, định dạng tài liệu tiêu chuẩn trong nghiên cứu toán học và vật lý.
Hệ thống được xây trên nền Gemini 3.1. Hiện tại, hệ thống dùng Gemini Deep Think nội bộ cho các lần thử chứng minh, và tích hợp với việc chạy Python cho khám phá tính toán. Hệ thống chưa tích hợp các engine toán học chuyên biệt của DeepMind (AlphaProof, AlphaEvolve, Aletheia) như thành phần nội bộ, nhưng được thiết kế để làm điều đó trong tương lai.
Vì sao AI Co-Mathematician quan trọng?
Nhà toán học hiện đã dùng LLM cho nhiều tác vụ như tổng hợp tài liệu, phác thảo chứng minh không chính thức, viết LaTeX khuôn mẫu và code khám phá, nhưng chưa từng có công cụ hạ tầng nào điều phối được quy trình phi tuyến tính mà họ thực sự sử dụng. Họ cũng dùng các công cụ AI khác, như trợ lý chứng minh hình thức, để xác minh chứng minh bằng máy.
Dù mỗi công cụ đều mạnh ở một phần cụ thể của quy trình tổng thể, nhà toán học vẫn phải tự ghép nối kết quả của các công cụ đó một cách thủ công. Đây chính là khoảng trống mà AI Co-Mathematician nhắm tới lấp đầy.
AI Co-Mathematician vận hành như thế nào?
Mô hình quy trình làm việc được điều chỉnh lỏng lẻo từ các công cụ AI coding như Claude Code hoặc Codex, nhưng không thể áp dụng trực tiếp vì phần mềm có spec và bộ test rõ ràng, trong khi nghiên cứu toán học phi tuyến tính, và mục tiêu ban đầu có thể mơ hồ hoặc chưa được định nghĩa. Quy trình của AI Co-Mathematician được vận hành bởi một hệ thống đa agent, gồm 5 bước:
- Khám phá ban đầu: thay vì yêu cầu một prompt hoàn hảo ngay từ đầu, nhà nghiên cứu tương tác hội thoại với hệ thống để tinh chỉnh mục tiêu cấp cao và hình thức hóa câu hỏi nghiên cứu, làm rõ ý định nghiên cứu trước khi công việc bắt đầu.
- Tổng hợp tài liệu: AI Co-Mathematician thực hiện tổng hợp tài liệu, xác định các bài báo quan trọng và trích xuất chứng minh cùng kỹ thuật toán học liên quan.
- Xây dựng khung tính toán: hệ thống tạo một thư viện Python tính toán, kèm các trường hợp minh họa và test đi kèm.
- Thực thi tìm kiếm: sau khi khung tính toán hoàn thành, thư viện tùy chỉnh được import và mở rộng tìm kiếm trên một cụm cloud, cung cấp cho nhà nghiên cứu báo cáo tiến độ cấp cao mà không nhấn chìm họ trong log chi tiết.
- Output cuối cùng: một bản viết LaTeX đã biên dịch, giải thích quá trình khám phá chứ không chỉ kết quả, dùng chú thích lề để liên kết các tuyên bố với tham chiếu hoặc output code cụ thể. Một báo cáo chỉ được đánh dấu hoàn tất sau khi mọi agent kiểm duyệt đồng ý. Các báo cáo không qua được kiểm duyệt vẫn được trình lên nhà nghiên cứu, gắn cờ là chưa giải quyết, đây chính là cách chứng minh có lỗi đến được tay Lackenby.
Kiến trúc workstream của AI Co-Mathematician gồm những gì?
Kiến trúc của AI Co-Mathematician là một hệ thống đa agent với một agent điều phối dự án cấp cao nhất và các sub-agent chuyên biệt.
Điều phối quy trình làm việc
Trước khi bất kỳ công việc nào được thực hiện, agent điều phối dự án mở một cuộc hội thoại với nhà nghiên cứu để tinh chỉnh mục tiêu qua các câu hỏi làm rõ. Ví dụ, một nhà nghiên cứu hỏi về trần trên của “bài toán sofa” (sofa problem), một câu hỏi mở trong hình học tính toán, có thể được hỏi lại liệu nên tập trung vào một biến thể cụ thể hay cả hai. Mục tiêu chính xác, đã được thống nhất, giới hạn phạm vi bài toán trước khi các agent được triển khai.
Sau khi mục tiêu đã chốt, agent điều phối dự án giao việc cho các agent và sub-agent, làm việc song song trừ khi có phụ thuộc bắt buộc phải tuần tự. Một agent thực hiện tổng hợp tài liệu, một agent khác xây dựng khung tính toán, và một agent khác thực hiện tìm kiếm. Vẫn có một ràng buộc phụ thuộc: việc tìm kiếm không thể thực thi cho đến khi thư viện tùy chỉnh từ khung tính toán đã tồn tại.
Tránh hallucination
Các agent thông thường thường tìm ra đường tắt không hợp lệ, hallucinate bổ đề, hoặc tuyên bố chiến thắng sớm, và AI Co-Mathematician dùng các cơ chế để tránh những sai sót này, bao gồm agent kiểm duyệt. Ví dụ, nếu không gian tìm kiếm bùng nổ trong lúc khám phá tính toán, sub-agent viết code không thể đánh dấu code đã hoàn thành cho đến khi mọi test pass và agent kiểm duyệt chấp nhận kết quả, khiến quy trình bị đình trệ. Lần khám phá thất bại này được ghi log và gửi đến agent điều phối dự án, người sau đó cảnh báo nhà nghiên cứu trong chat. Nhà nghiên cứu khi đó có thể đề xuất một hướng tiếp cận khác.
Những ngõ cụt này không chỉ được ghi log mà còn được xử lý như một loại thông tin: chúng được truy vết theo phiên bản và lưu giữ như một phần của hồ sơ nghiên cứu. Trong toán học, một hướng tiếp cận thất bại thường tiết lộ một ràng buộc hoặc chỉ ra một con đường khác.
Xuyên suốt quy trình, agent điều phối mặc định lọc bớt tín hiệu nhiễu cấp thấp, nhưng nhà nghiên cứu vẫn có thể đào sâu vào bất kỳ workstream nào và chỉnh sửa nếu cần.
Các case study đầu tiên phản ánh những chế độ hợp tác nào?
Một vài trường hợp sớm phản ánh các chế độ hợp tác khác nhau: một chứng minh có lỗi mở khóa insight của con người, một chú thích lề định hình lại câu hỏi, và việc phát hiện ngõ cụt nhanh chóng cứu được cả một tuần công sức đi sai hướng.
Vá một chứng minh bị hệ thống gắn cờ là sai
Marc Lackenby, giáo sư toán học tại Đại học Oxford, áp dụng hệ thống cho một bài toán từ sổ tay Kourovka, một tuyển tập các bài toán nghiên cứu mở trong lý thuyết nhóm. AI thử tạo một chứng minh, một agent kiểm duyệt phát hiện lỗ hổng trong chứng minh đó và báo cáo lại cho Lackenby. Ông biết cách vá lỗ hổng này.
Sự chuyển giao đó chính là điểm mấu chốt: con người bắt được điều mà máy đã bỏ lỡ, còn máy làm phần việc nặng nhọc xung quanh.
Theo dõi một chú thích lề dẫn đến insight mới
Gergely Bérczi, một giáo sư toán học khác, nghiên cứu một bài toán liên quan đến các giả thuyết hệ số Stirling. Để đánh giá ban đầu, ông cung cấp cho AI Co-Mathematician chủ đề, bối cảnh, các phương pháp đã biết, và một hướng đi tiềm năng được gợi ý từ thí nghiệm AlphaEvolve.
AI Co-Mathematician tạo ra chứng minh (hiện đang trong quá trình kiểm tra toán học của con người) cho hai giả thuyết, kèm bằng chứng tính toán chi tiết cho các tuyên bố đó. Bérczi cho biết hệ thống đã giúp ông bằng cách đưa ra một chú thích lề trong tài liệu hoàn thiện, điều này cảnh báo ông về một insight quan trọng mà sau đó ông theo đuổi tiếp trong giao diện chat.
Phát hiện ngõ cụt trước khi tốn một tuần công sức
Semon Rezchikov đặt ra một bài toán kỹ thuật về vi phôi Hamilton (Hamiltonian diffeomorphism). Ông và agent điều phối dự án thảo luận về bài toán cho đến khi thống nhất một định nghĩa chính xác cho nhiệm vụ. Bản viết do AI tạo ra bao gồm một bổ đề then chốt kèm chứng minh (sau đó được xác minh) về cơ bản giải quyết được câu hỏi.
Trong quá trình đó, một hướng tiếp cận đã được khám phá nhưng đi vào ngõ cụt. AI đến được ngõ cụt đó nhanh hơn nhiều so với thông thường, nên ông không lãng phí cả tuần theo đuổi hướng đi sai. Hệ thống nén một tuần công sức lãng phí thành vài giờ.
Kết quả benchmark FrontierMath của AI Co-Mathematician ra sao?
AI Co-Mathematician là một công cụ điều phối quy trình làm việc, không phải một công cụ giải bài toán toán học đơn thuần, nhưng các tác giả vẫn cần công bố benchmark cao vì ba lý do: chứng minh engine toán học nền đủ mạnh để làm cộng tác viên hữu ích cho toán học frontier, cho thấy benchmark cung cấp môi trường có kiểm soát để đo mức độ đóng góp của lớp điều phối, và cung cấp một chỉ số đại diện cho hiệu quả hợp tác khi chưa có thước đo chuẩn hóa nào tồn tại.
Kết quả: AI Co-Mathematician đạt 48% trên FrontierMath Tier 4, một benchmark cấp nghiên cứu, đây là điểm số cao nhất từng được công bố, vượt cả Gemini 3.1 Pro của chính Google, chỉ đạt 19% trên cùng bài kiểm tra, cùng tier. Epoch AI phát hiện lỗi trong khoảng một phần ba số bài toán FrontierMath (xuyên suốt Tier 1-4) và đang tiến hành kiểm tra thủ công.
AI Co-Mathematician đạt 87% trên một benchmark nội bộ của Google gồm 100 bài toán toán học cấp nghiên cứu chưa từng rò rỉ, có đáp án kiểm tra được bằng code, được lấy từ các nhà toán học chuyên nghiệp, trong khi Gemini 3.1 Pro đạt 57% và Gemini 3.1 Deep Think đạt 70%.
AI Co-Mathematician còn những giới hạn nào?
Nhóm tác giả minh bạch về các giới hạn cấu trúc của hệ thống.
- Cơ chế kiểm soát chất lượng chính đến từ agent kiểm duyệt và agent chứng minh. Vòng kiểm duyệt đối kháng có thể xuất hiện thiên lệch làm hài lòng người kiểm duyệt (reviewer-pleasing bias), tức các agent hội tụ về lập luận làm vừa lòng agent kiểm duyệt thay vì lập luận thực sự đúng. Đây là một lỗ hổng cấu trúc thực sự.
- Output LaTeX được trình bày gọn gàng có thể tạo cảm giác nghiêm ngặt giả tạo. Một tài liệu được định dạng tốt trông có vẻ hoàn thiện dù phần toán học phía sau có đúng hay không.
- Hệ thống chỉ hoạt động tốt khi nhà nghiên cứu thực sự là chuyên gia trong lĩnh vực. Có nguy cơ một người không phải chuyên gia giao một bài toán mơ hồ cho hệ thống và tin tưởng mù quáng vào output của nó.
- Chứng minh của AI vẫn cần con người xác minh. Ví dụ, các chứng minh của Bérczi vẫn đang trong quá trình kiểm tra của con người tại thời điểm công bố.
Kết luận
AI Co-Mathematician phản ánh một sự dịch chuyển từ việc yêu cầu AI giải một bài toán sang việc cùng làm việc với AI trong quy trình nghiên cứu toán học lặp đi lặp lại và lộn xộn. Điểm nghẽn thực sự nằm ở hạ tầng quy trình làm việc phản ánh đúng cách nhà toán học thực sự vận hành, chứ không nằm ở năng lực giải bài toán đơn lẻ. Trường hợp của Lackenby là minh chứng rõ nhất cho mô hình hợp tác này: máy làm phần việc nặng, con người bắt lấy insight mà máy bỏ lỡ.
Câu hỏi thường gặp
AI Co-Mathematician khác gì với ChatGPT hoặc Gemini?
ChatGPT và Gemini là công cụ hội thoại được tối ưu cho các lượt trao đổi đơn lẻ. AI Co-Mathematician là một không gian làm việc có trạng thái, chạy nhiều luồng nghiên cứu song song, theo dõi các lần thử thất bại, và quản lý một cuộc điều tra kéo dài nhiều tuần.
AI Co-Mathematician có thay thế nhà toán học không?
Không. Hệ thống hoạt động tốt nhất khi được điều khiển bởi một chuyên gia trong lĩnh vực, người có thể đánh giá output của hệ thống và nhận ra khi nào một chứng minh có lỗi vẫn chứa một ý tưởng hữu ích.
Hệ thống đa agent là gì?
Đây là một kiến trúc trong đó nhiều mô hình AI chuyên biệt cộng tác trên cùng một tác vụ. Trong AI Co-Mathematician, các agent riêng biệt xử lý tìm kiếm tài liệu, tính toán, thử chứng minh và kiểm duyệt đối kháng.
AI Co-Mathematician xử lý lỗi và ngõ cụt như thế nào?
Các lần thử thất bại được ghi log, theo dõi theo phiên bản, và báo lên nhà nghiên cứu thay vì bị loại bỏ. Trong toán học, một ngõ cụt thường tiết lộ một ràng buộc hoặc chỉ ra một con đường tốt hơn.
Output của hệ thống khác gì so với phản hồi AI thông thường?
Hệ thống tạo ra một tài liệu LaTeX đã biên dịch kèm chú thích lề liên kết các tuyên bố với bài báo hoặc output code cụ thể, thay vì văn xuôi không có tham chiếu. Một báo cáo chỉ được đánh dấu hoàn tất sau khi mọi agent kiểm duyệt đồng ý.



