Gemini 4 Argon là mô hình tiên tiến mới của Google DeepMind, được công bố vào ngày 30 tháng 9 năm 2026. Nó có thể tạo tới 1 triệu token trong một phản hồi duy nhất, giá $2 cho mỗi triệu token đầu vào và $10 cho mỗi triệu token đầu ra trong giai đoạn giới thiệu, và đạt tỷ lệ ảo giác thấp nhất trong số các mô hình cùng cấp độ trí tuệ. Điều hạn chế: hầu như không ai có thể sử dụng nó ngay bây giờ. Google đang phát hành nó đầu tiên, không có các giới hạn an toàn an ninh mạng, cho các đội bảo mật đã được kiểm duyệt trong Chương Trình Fairwind.
Sự kết hợp này khá hiếm. Hầu hết các lần ra mắt mô hình tiên tiến đều bắt đầu bằng bảng benchmark và trang API. Argon lại bắt đầu bằng danh sách quyền truy cập. Google đã đào tạo nó để tự động tìm, xác thực và vá các lỗ hổng quan trọng, quyết định khả năng này quá mạnh để phát hành ngay từ ngày đầu, và đưa nó cho các đội phòng thủ trước tiên.
Hướng dẫn này sẽ đề cập đến Argon thực sự là gì, những benchmark mà nó thắng và thua, chi phí thực tế của giới hạn đầu ra 1M token, cách cổng truy cập của nó so sánh với của OpenAI và Anthropic, và liệu bạn có nên lên kế hoạch dựa trên nó hay không.
Những Điểm Chính
- Gemini 4 Argon được công bố vào ngày 30 tháng 9 năm 2026 và đang được triển khai đầu tiên cho các đội phòng thủ an ninh mạng trong Chương Trình Fairwind của Google, tiếp theo là khách hàng API trả phí và người đăng ký Google AI Ultra.
- Giá giới thiệu là $2/$10 cho mỗi triệu token đầu vào/đầu ra, sẽ tăng lên $4/$20; token đầu vào đã lưu sẽ được giảm 95% so với giá gốc.
- Đầu ra bị giới hạn ở 1 triệu token mỗi phản hồi, tăng từ 64.000 token trên các mô hình Gemini trước.
- Argon dẫn đầu DeepSWE v1.1 (77,9%) và AutomationBench (51,3%) nhưng thua Claude Opus 5.5 trên Terminal-Bench 4.0 (57,4% so với 66,4%) và GPT-6 Astra trên FrontierSWE v2 (55,0% so với 65,5%).
- Tỷ lệ ảo giác 15% của nó trên benchmark của Artificial Analysis so sánh với 51% của GPT-6 Astra.
Gemini 4 Argon là gì?
Gemini 4 Argon là mô hình đầu tiên trong thế hệ Gemini 4 của Google, được xây dựng cho công việc dài, nhiều bước: các dự án phần mềm lớn, công việc kiến thức chuyên nghiệp và phòng thủ an ninh mạng. Tính năng nổi bật của nó là giới hạn đầu ra 1 triệu token, và Google đang phát hành nó cho các đội phòng thủ an ninh mạng đã được kiểm duyệt trước bất kỳ ai khác.
Theo thông báo của Google, Argon được thiết kế để "duy trì suy luận sâu" trong các quy trình dài hạn thay vì trả lời các câu hỏi nhanh. Những ví dụ mà Google chọn cho thấy rất rõ mục đích sử dụng. Nội bộ, các đội đã sử dụng nó để:
- di chuyển các cơ sở mã C và C++ lên tới hơn 800.000 dòng sang Rust;
- giải phóng 300 TiB bộ nhớ trên các trung tâm dữ liệu, với dự kiến từ 500 TiB đến 1 PiB;
- tăng tốc độ giải mã video libgav1 gấp 2,7 lần với đầu ra giống hệt;
- cải thiện tối ưu hoá thuật toán lượng tử lên 40% so với mức cơ bản.
Không có nhiệm vụ nào trong số đó là trò chuyện. Đó là loại công việc bạn thường giao cho một đội trong một quý. Cách đặt khung này quan trọng khi bạn đọc các benchmark, vì Argon được điều chỉnh cho thời lượng và độ tin cậy hơn là tốc độ thô trên các nhiệm vụ ngắn.
Benchmark Gemini 4 Argon: nơi nó dẫn đầu và nơi không
Gemini 4 Argon dẫn đầu trong các nhiệm vụ phần mềm dài, tự động hoá, hiểu video dài và độ tin cậy thực tế. Nó thua Claude Opus 5.5 trong lập trình dựa trên terminal và GPT-6 Astra trong benchmark kỹ thuật phần mềm khó nhất. Nó không thắng hoàn toàn, và biểu đồ của Google cũng không khẳng định như vậy.
| Benchmark | Gemini 4 Argon | Claude Opus 5.5 | GPT-6 Astra |
|---|---|---|---|
| DeepSWE v1.1 (long software tasks) | 77.9% | 74.2% | 74.1% |
| AutomationBench | 51.3% | 40.0% | 41.4% |
| Terminal-Bench 4.0 | 57.4% | 66.4% | 57.9% |
| FrontierSWE v2 | 55.0% | — | 65.5% |
| CWE-bench v1 (vulnerability work) | 68% (tied) | — | 68% (tied) |
| Artificial Analysis Intelligence Index | 53 | — | 53 |
| AA-Omniscience hallucination rate (lower is better) | 15% | — | 51% |
| LVBench (long video) | 91.7% | — | — |
Nguồn: Google, DevX, Anthropic và số liệu ra mắt của OpenAI. Dấu gạch ngang có nghĩa là không có điểm số công bố so sánh.
Con số về ảo giác mới là câu chuyện thực sự. Trong bài kiểm tra Omniscience của Artificial Analysis, Argon bị ảo giác ở 15% câu trả lời. GPT-6 Astra đạt 51% và GPT-6.1 Sol đạt 54%. Điểm trí tuệ thô hiện đã bằng nhau ở vị trí cao nhất (Argon và Astra đều đạt 53), vì vậy yếu tố phân biệt là tần suất mô hình tự tin tạo ra thông tin sai. Đối với một mô hình được thiết kế chạy không giám sát trong nhiều giờ, con số này quyết định bạn có tin tưởng đầu ra hay không.
Công việc terminal vẫn là của Anthropic. Nếu các tác nhân của bạn hoạt động trong một shell, thực hiện build, đọc log và sửa lỗi, điểm 66,4% của Claude Opus 5.5 trên Terminal-Bench 4.0 vượt lên 9 điểm. Chúng tôi đã giải thích tại sao benchmark này quan trọng trong bài phân tích Claude Opus 5.5 của mình.
Kết quả bảo mật bằng nhau với các mô hình cũng được giới hạn. Điểm 68% của Argon trên CWE-bench v1 bằng với GPT-6 Astra và Grok 4.7 của xAI, theo SecurityWeek. Bảng xếp hạng công việc tìm lỗ hổng hiện đang có ba mô hình bằng nhau, tất cả đều bị nhà sản xuất hạn chế.
Gemini 4 Argon có giá bao nhiêu?
Gemini 4 Argon có giá $2 cho mỗi triệu token đầu vào và $10 cho mỗi triệu token đầu ra trong giai đoạn giới thiệu, sau đó là $4 và $20. Token đầu vào đã lưu được giảm 95% so với giá gốc. Điều này khiến nó rẻ hơn nhiều so với GPT-6 Astra và có mức giá danh sách bằng Claude Opus 5.5 sau khi khuyến mãi kết thúc.
| Mô hình | Đầu vào ($/M) | Đầu ra ($/M) | Đầu ra tối đa mỗi phản hồi |
|---|---|---|---|
| Gemini 4 Argon (intro) | $2 | $10 | 1,000,000 |
| Gemini 4 Argon (standard) | $4 | $20 | 1,000,000 |
| Claude Opus 5.5 | $4 | $20 | 128,000 |
| GPT-6 Astra | $10 | $50 | — |
| GPT-6 Sol | $2 | $10 | — |
So sánh quan trọng không phải là bảng giá. Quan trọng là giới hạn 1M đầu ra cho phép một yêu cầu duy nhất tốn bao nhiêu. Dưới đây là phép tính cho trường hợp cực đoan nhất, một phản hồi sử dụng toàn bộ ngân sách đầu ra:
def response_cost(output_tokens, price_per_million):
return output_tokens / 1_000_000 * price_per_million
max_output = 1_000_000
print(response_cost(max_output, 10)) # Argon, intro pricing -> 10.0
print(response_cost(max_output, 20)) # Argon, standard -> 20.0
print(response_cost(128_000, 20)) # Opus 5.5 at its cap -> 2.56
Một phản hồi Argon đạt tối đa sẽ tốn $10 hiện tại và $20 sau này. Đó không phải là lý do để tránh dùng nó. Một việc refactor dài được thực hiện trong một lần có thể rẻ hơn hai mươi lần gọi ngắn mà mỗi lần phải đọc lại cơ sở mã. Tuy nhiên nó thay đổi cách bạn lập ngân sách. Với giới hạn 64K, một phản hồi chạy quá mức chỉ tốn vài cent. Với giới hạn 1M, một vòng lặp tác nhân cấu hình sai có thể tiêu tốn tiền thực trong vài phút. Hãy đặt một ngưỡng đầu ra rõ ràng cho mỗi cuộc gọi, và theo dõi chi phí cho mỗi nhiệm vụ hoàn thành thay vì cho mỗi yêu cầu.
Ai có thể sử dụng Gemini 4 Argon ngay bây giờ?
Hiện tại, chỉ các đội trong Chương Trình Fairwind của Google và các đội nội bộ của Google mới có thể sử dụng Gemini 4 Argon. Google cho biết khách hàng API trả phí và người đăng ký Google AI Ultra sẽ là những người tiếp theo, sau đó là quyền truy cập rộng rãi hơn cho nhà phát triển và doanh nghiệp, nhưng chưa công bố ngày cụ thể.
Fairwind được ra mắt vào đầu tháng 9 như một chương trình chỉ nhận đơn đăng ký cho các chính phủ, khách hàng Google Cloud và đối tác bảo mật, và có hơn 650 người tham gia khi khởi động, theo BetaNews. Nó bắt đầu với Gemini 3.8 Flash Cyber kết hợp với CodeMender, công cụ của Google giúp tìm, xác thực và sửa lỗ hổng. Chúng tôi đã đề cập đến làn sóng đầu tiên này trong bài đánh giá Gemini 3.8 Flash của mình.
Điều thay đổi với Argon là cụm từ Google dùng: các đội phòng thủ đáng tin cậy nhận được nó "không có giới hạn an toàn an ninh mạng". Thực tế, điều này có nghĩa là mô hình sẽ thực hiện công việc khám phá và xác thực lỗ hổng mà một mô hình công cộng sẽ từ chối. Wiz, công ty mà Google mua lại, đã sử dụng nó trong nỗ lực Scan for Good cho cơ sở hạ tầng quan trọng, và Google cho biết Argon đã phát hiện một lỗ hổng nghiêm trọng trong phần mềm bệnh viện mà các mô hình tiên tiến trước đó đã bỏ lỡ.
Bản phát hành rộng rãi hơn vẫn giữ các biện pháp bảo vệ. Google liệt kê việc huấn luyện từ chối các yêu cầu tấn công mạng và CBRN, giám sát các kích hoạt nội bộ của mô hình để phát hiện lạm dụng, giám sát chuỗi suy nghĩ và hành động để tránh lệch hướng, và huấn luyện đối kháng khiến nó trở thành "mô hình chịu đựng nhất cho đến nay" trước các tấn công chèn lời nhắc gián tiếp.
Fairwind vs Daybreak vs Cyber Verification: ba cổng, một mẫu
Cả ba phòng thí nghiệm tiên tiến đều đã đi đến kết luận giống nhau: xây dựng khả năng bảo mật cấp tấn công, sau đó hạn chế ai có thể gọi nó. Cơ chế thực hiện khác nhau theo cách quan trọng nếu đội của bạn làm công việc bảo mật.
| OpenAI | Anthropic | ||
|---|---|---|---|
| Chương trình | Fairwind | Daybreak | Cyber Verification Program |
| Mô hình bị giới hạn | Gemini 4 Argon, Gemini 3.8 Flash Cyber | GPT-6 Astra (full capability) | Claude Opus 5.5 on cyber tasks |
| Những gì công chúng nhận được | Argon later, with guardrails | Astra with code review and patching, no exploit PoCs | Cyber tasks routed to Opus 4.8 |
| Điều kiện tham gia | Application; governments, Cloud customers, partners | Application; vetted defenders | Application; verified security teams |
Phiên bản của Google là quyết liệt nhất theo một hướng: họ đã phát hành flagship mới nhất cho các đội phòng thủ trước khi công chúng có thể truy cập. OpenAI và Anthropic đã phát hành mô hình của họ rộng rãi và giới hạn khả năng nguy hiểm. Google lại giới hạn toàn bộ mô hình.
Nhận định của chúng tôi là cách sắp xếp của Google là trung thực hơn. Một mô hình có thể tự động tìm và vá các lỗi nghiêm trọng cũng có thể tìm chúng cho người không vá. Việc cho các đội phòng thủ đi trước có nghĩa là những phát hiện quan trọng nhất sẽ được chuyển thành bản vá thay vì khai thác. Chi phí là các nhà phát triển thông thường phải chờ, và chúng ta vẫn chưa biết các giới hạn an toàn của phiên bản công cộng sẽ hạn chế khả năng của Argon như thế nào.
Nếu đội của bạn cần loại khả năng này, bài học từ GPT-6 Astra cũng áp dụng ở đây: lên kế hoạch cho quy trình đăng ký, không phải thẻ tín dụng. Và bất kỳ mô hình nào bạn sử dụng, các quy tắc kiểm soát từ bài viết của chúng tôi về bảo mật tác nhân mã AI còn quan trọng hơn đối với một mô hình được xây dựng để tìm lỗ hổng.
Gemini 4 Argon có tốt hơn Claude Opus 5.5 hay GPT-6 Astra không?
Gemini 4 Argon tốt hơn cho các công việc tự động dài mà độ tin cậy là quan trọng nhất, Claude Opus 5.5 tốt hơn cho lập trình dựa trên terminal, và GPT-6 Astra tốt hơn cho các nhiệm vụ kỹ thuật phần mềm và toán học khó nhất. Không mô hình nào thắng mọi thứ, vì vậy lựa chọn phù hợp phụ thuộc vào dạng tải công việc của bạn.
| Công việc | Lựa chọn tốt nhất hiện tại | Lý do |
|---|---|---|
| Refactor và di chuyển kéo dài nhiều giờ | Gemini 4 Argon (once available) | Leads DeepSWE v1.1, 1M output, lowest hallucination rate |
| Tác nhân mã dựa trên shell | Claude Opus 5.5 | 66.4% on Terminal-Bench 4.0, available now at $4/$20 |
| Các vấn đề SWE và toán học khó nhất | GPT-6 Astra | 65.5% on FrontierSWE v2, but $10/$50 |
| Tự động hoá quy trình kinh doanh | Gemini 4 Argon | 51.3% on AutomationBench, 10 points clear |
| Lập trình hàng ngày với ngân sách hạn chế | GPT-6 Sol | $2/$10 and available today |
| Nghiên cứu lỗ hổng | Whichever gate you can get through | All three tie on CWE-bench v1 |
Có một điểm thực tế mà các bảng benchmark không hiển thị: bạn không thể triển khai trên một mô hình mà bạn không thể gọi được. Cho đến khi Argon có API trả phí, nó chỉ là dữ liệu lập kế hoạch, không phải lựa chọn sản xuất. Nếu bạn đang chọn mô hình trong tháng này, hãy chọn giữa những gì có sẵn, Opus 5.5 và GPT-6 Sol cho hầu hết các đội, và ưu tiên GPT-6 Sol khi chi phí quan trọng hơn một vài điểm benchmark cuối cùng.
Điều đáng làm ngay bây giờ là chuẩn bị cho giới hạn đầu ra. Các pipeline được xây dựng quanh các phản hồi 64K hoặc 128K thường chia công việc dài thành nhiều lần gọi và ghép kết quả lại. Phản hồi 1M token loại bỏ phần lớn khung sườn này, nhưng chỉ khi công cụ của bạn có thể truyền luồng, lưu trữ và xác thực đầu ra lớn như vậy. Kiểm tra thời gian chờ và log của bạn trước khi mô hình đến, không phải sau.
Câu hỏi thường gặp
Gemini 4 Argon là gì?
Gemini 4 Argon là mô hình tiên tiến của Google DeepMind được công bố vào ngày 30 tháng 9 năm 2026, được xây dựng cho công việc dài, nhiều bước trong kỹ thuật phần mềm, công việc kiến thức và phòng thủ an ninh mạng. Nó có thể tạo ra tới 1 triệu token đầu ra mỗi phản hồi và đang được triển khai đầu tiên cho các đội phòng thủ an ninh mạng đã được kiểm duyệt.
Khi nào Gemini 4 Argon sẽ có sẵn cho các nhà phát triển?
Google chưa công bố ngày cụ thể. Argon hiện chỉ có sẵn qua Chương Trình Fairwind và nội bộ Google; khách hàng API trả phí và người đăng ký Google AI Ultra sẽ là những người tiếp theo, sau đó là quyền truy cập rộng rãi hơn cho nhà phát triển và doanh nghiệp.
Gemini 4 Argon có giá bao nhiêu?
Gemini 4 Argon có giá $2 cho mỗi triệu token đầu vào và $10 cho mỗi triệu token đầu ra ở mức giá giới thiệu. Giá tiêu chuẩn là $4 và $20, và token đầu vào đã lưu được giảm 95% so với giá gốc.
Chương Trình Fairwind của Google là gì?
Fairwind là chương trình truy cập sớm chỉ nhận đơn đăng ký của Google dành cho các đội bảo mật đã được kiểm duyệt, bao gồm chính phủ, khách hàng Google Cloud và đối tác bảo mật. Nó được ra mắt vào đầu tháng 9 năm 2026 với hơn 650 đối tác và cung cấp cho thành viên Argon mà không có các giới hạn an toàn an ninh mạng mà phiên bản công cộng sẽ có.
Gemini 4 Argon có tốt hơn Claude Opus 5.5 không?
Không phải trong mọi khía cạnh. Argon dẫn đầu trong các nhiệm vụ phần mềm dài (77,9% so với 74,2% trên DeepSWE v1.1) và tự động hoá, trong khi Claude Opus 5.5 dẫn đầu trong lập trình dựa trên terminal (66,4% so với 57,4% trên Terminal-Bench 4.0) và hiện đã có sẵn.
Giới hạn đầu ra 1 triệu token có nghĩa là gì?
Nó có nghĩa là một phản hồi Argon có thể dài tới 1 triệu token, khoảng 15 lần giới hạn 64.000 token trên các mô hình Gemini trước. Điều này cho phép đầu ra rất lớn, như toàn bộ cơ sở mã đã di chuyển, trong một lần, với chi phí tối đa $10 cho một phản hồi đạt giới hạn ở mức giá giới thiệu.
Kết luận
Gemini 4 Argon là lập luận mạnh mẽ nhất của Google cho thấy nó xứng đáng đứng đầu các mô hình tiên tiến. Nó thắng trong công việc phần mềm dài hạn, tự động hoá và quan trọng nhất là độ tin cậy, với tỷ lệ ảo giác ít hơn một phần ba so với GPT-6 Astra. Giá của nó cũng thấp hơn Astra đáng kể, ít nhất trong giai đoạn giới thiệu.
Nhận định của chúng tôi: Argon là mô hình cần lên kế hoạch cho các công việc dài, không có giám sát, và không phải là mô hình phù hợp để ra mắt trong tháng này, vì bạn có thể chưa gọi được nó. Hãy sử dụng Claude Opus 5.5 hoặc GPT-6 Sol cho những gì bạn đang triển khai ngay, và chuẩn bị pipeline cho các phản hồi 1M token để có thể chuyển đổi ngay khi API mở. Đối với phần rẻ hơn, có sẵn trong danh mục của Google, hãy bắt đầu với bài đánh giá Gemini 3.8 Flash của chúng tôi.
Mánh khóe mới nhất của các mô hình tiên tiến không phải là điểm số cao hơn. Đó là việc quyết định ai nhận mô hình trước.