Google ra mắt Gemini 3.6 Flash, Flash-Lite và Flash Cyber: Có gì mới?
Ngày 21/7/2026, Google chính thức công bố ba mô hình AI mới thuộc dòng Gemini Flash: Gemini 3.6 Flash, Gemini 3.5 Flash-Lite và Gemini 3.5 Flash Cyber. Ba model cùng thuộc dòng Flash nhưng hướng đến những nhu cầu khác nhau. Gemini 3.6 Flash cân bằng hiệu năng và tốc độ cho các tác vụ sản xuất thông thường, Gemini 3.5 Flash-Lite tối ưu chi phí và tốc độ cho lưu lượng xử lý lớn, còn Gemini 3.5 Flash Cyber tập trung phát hiện và xử lý lỗ hổng phần mềm trong môi trường bảo mật được kiểm soát chặt chẽ.
>>> Đăng ký Internet FPT tốc độ cao, ổn định để học tập, làm việc với công cụ AI. Thanh toán cước từ 3 tháng nhận ưu đãi Camera và 12 tháng lưu trữ Cloud. Đăng ký ngay hôm nay!
Google giới thiệu ba model Gemini Flash mới
Gemini 3.6 Flash và Gemini 3.5 Flash-Lite đã được phát hành ở trạng thái ổn định, sẵn sàng cho các ứng dụng thực tế. Gemini 3.5 Flash Cyber có phạm vi triển khai riêng khi chưa được cung cấp công khai qua Gemini API hay ứng dụng Gemini.
Ba model có thể được phân biệt theo định hướng chính:
| Model | Định vị | Tác vụ nổi bật | Khả năng truy cập |
| Gemini 3.6 Flash | Model Flash chủ lực mới | Lập trình, tác vụ nhiều bước, xử lý đa phương thức và công việc tri thức | Gemini, Gemini API, AI Studio, Android Studio, Antigravity và nền tảng doanh nghiệp |
| Gemini 3.5 Flash-Lite | Model nhanh và tiết kiệm | Phân loại, dịch thuật, trích xuất dữ liệu, xử lý tài liệu và tác vụ số lượng lớn | Gemini, Gemini API, AI Studio, Android Studio, nền tảng doanh nghiệp và Google Search |
| Gemini 3.5 Flash Cyber | Model an ninh mạng chuyên biệt | Tìm, xác minh và vá lỗ hổng phần mềm | Thử nghiệm giới hạn qua CodeMender |
Gemini 3.6 Flash và Gemini 3.5 Flash-Lite đều tiếp nhận văn bản, hình ảnh, âm thanh, video và tệp PDF. Hai model có cửa sổ ngữ cảnh đầu vào tối đa 1.048.576 token, đầu ra tối đa 65.536 token và chỉ hỗ trợ đầu ra dạng văn bản.
Gemini 3.6 Flash là gì?
Gemini 3.6 Flash là model Flash chủ lực mới của Google, được thiết kế để duy trì năng lực xử lý cao nhưng giảm chi phí và lượng token sử dụng. Model phù hợp với những quy trình cần lập trình, gọi công cụ, phân tích dữ liệu đa phương thức hoặc thực hiện nhiều bước liên tiếp.
Tiết kiệm token và giảm chi phí đầu ra
Theo Google, Gemini 3.6 Flash sử dụng ít hơn khoảng 17% token đầu ra so với Gemini 3.5 Flash trên Artificial Analysis Index. Model cũng có xu hướng hoàn thành quy trình với ít bước suy luận, lượt hội thoại và lần gọi công cụ hơn, qua đó hạn chế tình trạng tác vụ bị kéo dài không cần thiết.
Giá API tiêu chuẩn của Gemini 3.6 Flash là:
Đầu vào: 1,50 USD/1 triệu token.
Đầu ra: 7,50 USD/1 triệu token.
Giá đầu vào được giữ nguyên so với Gemini 3.5 Flash, trong khi giá đầu ra giảm từ 9 USD xuống 7,50 USD cho mỗi 1 triệu token. Mức giảm này có ý nghĩa đối với ứng dụng thường xuyên tạo nội dung dài hoặc vận hành nhiều AI agent cùng lúc.
Lập trình và thực hiện tác vụ nhiều bước tốt hơn
Gemini 3.6 Flash được cải thiện về độ chính xác khi lập trình, hạn chế những chỉnh sửa mã ngoài ý muốn và giảm số vòng thực thi. Model cũng cần ít bước suy luận và lượt gọi công cụ hơn để hoàn thành các quy trình gồm nhiều công đoạn.
Trên DeepSWE, kết quả của Gemini 3.6 Flash tăng từ 37% lên 49%. Điểm MLE Bench tăng từ 49,7% lên 63,9%, cho thấy khả năng xử lý các nhiệm vụ lập trình và Kỹ thuật máy học (Machine learning) được nâng lên so với Gemini 3.5 Flash.
Khả năng tương tác với môi trường máy tính cũng được cải thiện, thể hiện qua điểm OSWorld-Verified tăng từ 78,4% lên 83%. Sử dụng máy tính hiện được tích hợp dưới dạng công cụ phía máy khách thông qua Gemini API và Gemini Enterprise, hỗ trợ xây dựng các quy trình tự động hóa có tương tác với giao diện phần mềm.
Xử lý tài liệu và dữ liệu đa phương thức
Bên cạnh lập trình, Gemini 3.6 Flash còn được cải thiện trong các công việc cần đọc và tổng hợp nhiều loại thông tin. Model có thể phân tích tài liệu, biểu đồ và dữ liệu, sau đó kết nối các nội dung quan trọng để hỗ trợ soạn thảo báo cáo.
Ngoài ra, Gemini 3.6 Flash có thể xử lý dữ liệu tài chính cùng bản ghi nội dung hoặc phối hợp nhiều tác nhân để thực hiện chuyển đổi mã. Khả năng hiểu thông tin trực quan cũng giúp model tham gia vào các quy trình xây dựng công cụ xử lý hình ảnh và giao diện tương tác.
Gemini 3.5 Flash-Lite là gì?
Gemini 3.5 Flash-Lite là model nhanh và có chi phí thấp nhất trong dòng Gemini 3.5. Model được tối ưu cho hệ thống phải xử lý số lượng yêu cầu lớn, trong đó tốc độ phản hồi và chi phí vận hành quan trọng hơn khả năng suy luận chuyên sâu của từng lượt gọi.
Tốc độ cao với chi phí API thấp
Theo kết quả Artificial Analysis được Google dẫn lại, Gemini 3.5 Flash-Lite đạt khoảng 350 token đầu ra mỗi giây. Đây là kết quả trong điều kiện đánh giá cụ thể, không phải tốc độ được bảo đảm trên mọi ứng dụng hoặc cấu hình hệ thống.
Giá API của Gemini 3.5 Flash-Lite gồm:
Đầu vào: 0,30 USD/1 triệu token.
Đầu ra: 2,50 USD/1 triệu token.
So với Gemini 3.6 Flash, chi phí đầu vào của Flash-Lite thấp hơn năm lần, còn chi phí đầu ra bằng một phần ba. Model vì vậy phù hợp với ứng dụng phải xử lý hàng nghìn hoặc hàng triệu yêu cầu có cấu trúc tương đối đơn giản.
Phù hợp với tác vụ lặp lại và xử lý hàng loạt
Gemini 3.5 Flash-Lite được thiết kế cho các quy trình như:
Dịch hóa đơn hoặc tài liệu số lượng lớn.
Phân loại phản hồi của khách hàng.
Trích xuất thuộc tính sản phẩm.
Đọc và tóm tắt chứng từ.
Phân luồng yêu cầu theo chủ đề.
Chuyển dữ liệu thành JSON có cấu trúc.
Tạo tác nhân phụ trong hệ thống nhiều agent.
Phân tích tài liệu với độ trễ thấp.
Model hỗ trợ thực thi mã, tìm kiếm tệp, gọi hàm, đầu ra có cấu trúc và nhiều công cụ tích hợp khác. Tuy nhiên, trang thông số riêng của Google hiện ghi Gemini 3.5 Flash-Lite không hỗ trợ tính năng Sử dụng máy tính.
Có thể điều chỉnh mức độ suy luận
Mức suy luận mặc định của Gemini 3.5 Flash-Lite là "minimal", giúp ưu tiên tốc độ và giảm chi phí cho những tác vụ đơn giản. Nhà phát triển có thể tăng mức suy luận khi model phải xử lý chuỗi yêu cầu phức tạp hơn.
Cách thiết lập này cho phép Flash-Lite đảm nhận cả tác vụ phản hồi nhanh lẫn vai trò tác nhân phụ trong một hệ thống AI nhiều tầng. Dù vậy, khi yêu cầu cần lập kế hoạch dài, phân tích sâu hoặc chỉnh sửa codebase phức tạp, Gemini 3.6 Flash vẫn là lựa chọn phù hợp hơn.
>>> Lắp Combo Internet - Truyền hình FPT để truy cập mạng tốc độ cao, tải tài liệu, cập nhật kiến thức công nghệ và giải trí thuận tiện trên TV, điện thoại, máy tính bảng hoặc laptop. Đồng thời theo dõi Ngoại hạng Anh 2026/27 và ASEAN Hyundai Cup 2026 trên FPT Play! Khách hàng đăng ký và thanh toán từ 3 tháng cước còn nhận ưu đãi Camera và 12 tháng lưu trữ Cloud!
Gemini 3.5 Flash Cyber là gì?
Gemini 3.5 Flash Cyber là model an ninh mạng được xây dựng trên Gemini 3.5 Flash và tinh chỉnh riêng cho việc tìm, xác minh và vá lỗ hổng phần mềm. Model không được phát triển như một chatbot phổ thông hoặc lựa chọn API dành cho mọi lập trình viên.
Tìm và vá lỗ hổng phần mềm
Gemini 3.5 Flash Cyber là phiên bản chuyên biệt được phát triển trên nền Gemini 3.5 Flash, tập trung vào việc phát hiện, xác thực và khắc phục lỗ hổng trong mã nguồn. Model được tích hợp vào CodeMender, nơi nhiều tác nhân cùng xử lý các phần khác nhau của quá trình kiểm tra trước khi tổng hợp kết quả thành một báo cáo thống nhất.
Trong bài đánh giá CyberGym, Gemini 3.5 Flash Cyber đạt 83,2% khi vận hành trong CodeMender với tối đa 5 lượt gọi model. Kết quả này cho thấy model có thể duy trì hiệu suất cạnh tranh khi xử lý các nhiệm vụ bảo mật phần mềm, đồng thời tận dụng kiến trúc nhiều tác nhân để mở rộng phạm vi tìm kiếm và đối chiếu kết quả.
Khả năng chuyên biệt của model cũng thể hiện rõ trong Big Sleep Evaluation, nơi Gemini 3.5 Flash Cyber đạt 72%, cao hơn Gemini 3.6 Flash ở mức 42% và Gemini 3.5 Flash ở mức 36%. Trong thử nghiệm trên JavaScript Engine V8 với số lượt gọi cố định, model tìm được 55 vấn đề riêng biệt đã được xác nhận, so với 47 vấn đề của Gemini 3.5 Flash.
Do công nghệ này có thể được sử dụng cho cả mục đích phòng thủ và tấn công, Google triển khai Gemini 3.5 Flash Cyber theo chương trình thử nghiệm giới hạn dành cho chính phủ và các đối tác đáng tin cậy thông qua CodeMender.
Chưa mở cho người dùng thông thường
Gemini 3.5 Flash Cyber chưa được cung cấp trong ứng dụng Gemini, Google AI Studio hoặc Gemini API công khai. Google dự kiến triển khai model qua CodeMender trong một chương trình thử nghiệm giới hạn dành cho chính phủ và các đối tác được lựa chọn.
Cách tiếp cận hạn chế xuất phát từ tính chất lưỡng dụng của công nghệ an ninh mạng. Công cụ có thể giúp đội ngũ phòng thủ phát hiện lỗ hổng sớm hơn, nhưng cũng có nguy cơ bị sử dụng để tìm điểm yếu với mục đích không phù hợp.
So sánh Gemini 3.6 Flash, 3.5 Flash-Lite và Flash Cyber
| Tiêu chí | Gemini 3.6 Flash | Gemini 3.5 Flash-Lite | Gemini 3.5 Flash Cyber |
| Mục tiêu chính | Cân bằng chất lượng, tốc độ và chi phí | Độ trễ thấp, chi phí thấp và thông lượng cao | Tìm, xác minh và vá lỗ hổng |
| Tác vụ phù hợp | Lập trình, phân tích tài liệu, AI agent nhiều bước | Dịch thuật, phân loại, trích xuất và xử lý hàng loạt | Kiểm tra an ninh mã nguồn |
| Định dạng đầu vào | Văn bản, hình ảnh, âm thanh, video, PDF | Văn bản, hình ảnh, âm thanh, video, PDF | Mã nguồn và dữ liệu phục vụ kiểm tra bảo mật |
| Đầu ra | Văn bản | Văn bản | Kết quả và báo cáo trong CodeMender |
| Cửa sổ ngữ cảnh | 1.048.576 token | 1.048.576 token | Chưa công bố dưới dạng API riêng |
| Đầu ra tối đa | 65.536 token | 65.536 token | Chưa công bố |
| Giá đầu vào | 1,50 USD/1 triệu token | 0,30 USD/1 triệu token | Chưa công bố |
| Giá đầu ra | 7,50 USD/1 triệu token | 2,50 USD/1 triệu token | Chưa công bố |
| Sử dụng máy tính | Có, ở trạng thái thử nghiệm | Không hỗ trợ theo trang thông số model | Triển khai trong CodeMender |
| Tình trạng | Đã phát hành ổn định | Đã phát hành ổn định | Thử nghiệm giới hạn |
| Người dùng chính | Cá nhân, lập trình viên và doanh nghiệp | Nhà phát triển có lưu lượng xử lý lớn | Chính phủ và đối tác được lựa chọn |
Nên sử dụng model Gemini nào?
Chọn Gemini 3.6 Flash khi cần xử lý tác vụ phức tạp
Gemini 3.6 Flash phù hợp khi ứng dụng cần cân bằng giữa năng lực xử lý, tốc độ và chi phí. Model có lợi thế trong các trường hợp:
Tạo, kiểm tra và chỉnh sửa mã nguồn.
Phân tích tài liệu dài.
Đọc dữ liệu đa phương thức.
Xây dựng AI agent nhiều bước.
Thực hiện quy trình có gọi công cụ.
Phân tích biểu đồ và dữ liệu không gian.
Tái cấu trúc codebase.
Đây cũng là lựa chọn nâng cấp phù hợp cho ứng dụng đang sử dụng Gemini 3.5 Flash, Gemini 3 Flash Preview hoặc Gemini 3.1 Pro nhưng muốn giảm chi phí cho mỗi tác vụ.
Chọn Gemini 3.5 Flash-Lite khi ưu tiên tốc độ
Gemini 3.5 Flash-Lite phù hợp với ứng dụng có lượng truy vấn lớn nhưng từng yêu cầu không cần suy luận quá sâu. Một số ví dụ gồm chatbot phân loại yêu cầu, xử lý hóa đơn, dịch nội dung, trích xuất dữ liệu sản phẩm hoặc tạo tác nhân phụ.
Mức giá thấp giúp Flash-Lite giảm chi phí tổng thể khi hệ thống phải gọi API liên tục. Tuy nhiên, model không phải lựa chọn tối ưu cho nhiệm vụ cần lập kế hoạch dài hoặc thực hiện các vòng lập trình phức tạp.
Gemini 3.5 Flash Cyber dành cho tổ chức bảo mật
Gemini 3.5 Flash Cyber chỉ phù hợp với chính phủ và đối tác tham gia chương trình CodeMender giới hạn. Lập trình viên và doanh nghiệp thông thường chưa thể chọn model này trong Google AI Studio hoặc gọi trực tiếp bằng API.
Doanh nghiệp có nhu cầu bảo mật mã nguồn vẫn có thể tiếp cận một số khả năng nền tảng của CodeMender thông qua các model Gemini phổ biến trên Gemini Enterprise Agent Platform. Điều này không đồng nghĩa với quyền sử dụng trực tiếp Gemini 3.5 Flash Cyber.
Cách truy cập Gemini 3.6 Flash và 3.5 Flash-Lite
Gemini 3.6 Flash và Gemini 3.5 Flash-Lite được phát hành ở trạng thái Generally Available, nghĩa là đã sẵn sàng cho môi trường sản xuất. Người dùng có thể truy cập hai model qua các nhóm nền tảng sau:
Người dùng phổ thông: sử dụng qua ứng dụng Gemini tùy phạm vi triển khai trên từng tài khoản.
Lập trình viên: gọi Gemini API qua Google AI Studio hoặc Android Studio.
Doanh nghiệp: triển khai qua Gemini Enterprise Agent Platform.
Gemini 3.6 Flash: có thêm trên Google Antigravity và ứng dụng Gemini Enterprise.
Gemini 3.5 Flash-Lite: đang được đưa vào Google Search.
Mã model dành cho API là:
gemini-3.6-flash
gemini-3.5-flash-lite
Hai model đều là phiên bản ổn định. Nhà phát triển có thể dùng trực tiếp mã model này thay vì một tên preview thay đổi theo thời gian.
Các câu hỏi liên quan đến Gemini 3.6 Flash, 3.5 Flash-Lite và 3.5 Flash Cyber
Gemini 3.6 Flash ra mắt khi nào?
Google công bố và phát hành Gemini 3.6 Flash ngày 21/7/2026 cùng Gemini 3.5 Flash-Lite và Gemini 3.5 Flash Cyber.
Gemini 3.6 Flash có miễn phí không?
Gemini 3.6 Flash được cung cấp trong ứng dụng Gemini, nhưng quyền truy cập và hạn mức có thể phụ thuộc vào tài khoản hoặc gói sử dụng. Khi gọi qua Gemini API, model được tính phí theo số token đầu vào và đầu ra.
Gemini 3.5 Flash-Lite có nhanh hơn Gemini 3.6 Flash không?
Gemini 3.5 Flash-Lite được Google định vị là model nhanh nhất trong dòng Gemini 3.5 và đạt khoảng 350 token đầu ra mỗi giây trong phép đo được công bố. Gemini 3.6 Flash hướng đến chất lượng cao hơn trong lập trình, tác vụ nhiều bước và xử lý đa phương thức.
Gemini 3.6 Flash có tạo hình ảnh hoặc video không?
Không. Gemini 3.6 Flash nhận được hình ảnh và video ở đầu vào nhưng chỉ tạo văn bản ở đầu ra. Model cũng không hỗ trợ tạo âm thanh.
Gemini 3.5 Flash-Lite có cửa sổ ngữ cảnh bao nhiêu?
Model hỗ trợ tối đa 1.048.576 token đầu vào và 65.536 token đầu ra.
Người dùng thông thường có thể sử dụng Gemini 3.5 Flash Cyber không?
Chưa. Model dự kiến chỉ được cung cấp qua CodeMender cho chính phủ và các đối tác được Google lựa chọn trong chương trình thử nghiệm giới hạn.
Gemini 3.5 Flash Cyber có API riêng không?
Google chưa công bố Gemini API hoặc bảng giá sử dụng độc lập dành cho Gemini 3.5 Flash Cyber. Model hiện được triển khai trong hệ thống CodeMender.
Lời kết
Gemini 3.6 Flash, Gemini 3.5 Flash-Lite và Gemini 3.5 Flash Cyber thể hiện ba hướng phát triển rõ ràng của dòng Gemini Flash. Gemini 3.6 Flash phù hợp với lập trình và tác vụ AI phức tạp, Flash-Lite tối ưu cho hệ thống cần tốc độ và chi phí thấp, còn Flash Cyber phục vụ hoạt động tìm và xử lý lỗ hổng phần mềm trong môi trường được kiểm soát. Việc lựa chọn model cần dựa trên độ phức tạp của tác vụ, lưu lượng xử lý, ngân sách API và yêu cầu bảo mật của từng hệ thống.
>>> Lắp đặt Combo Internet + Truyền hình FPT để các thành viên trong gia đình cùng truy cập mạng, nghiên cứu AI, học trực tuyến, làm việc và thưởng thức Ngoại hạng Anh 2026/27, ASEAN Hyundai Cup™ 2026 cùng các nội dung giải trí trên FPT Play. Thanh toán cước từ 3 tháng còn nhận ưu đãi Camera và 12 tháng lưu trữ Cloud! Đăng ký ngay!

