OpenAI ngày 3/9 đã công bố GPT-6 Astra, mô hình được hãng mô tả là có năng lực cao nhất từng được triển khai rộng rãi. Astra cũng là mô hình đầu tiên của OpenAI đạt cấp độ “Critical” về năng lực an ninh mạng theo Preparedness Framework - khung đánh giá mức độ sẵn sàng của các mô hình AI tiên tiến.
Theo OpenAI, GPT-6 Astra có độ bền cao hơn các thế hệ trước, đặc biệt trước các cuộc tấn công “jailbreak” - kỹ thuật tìm cách vượt qua giới hạn an toàn của mô hình. Theo hãng, Astra chống jailbreak tốt hơn GPT-5.6 Sol, kể cả trong các chuỗi tác vụ kéo dài.
Kết luận này dựa trên các bài kiểm tra ngoại tuyến, chương trình kiểm thử jailbreak nội bộ và bên ngoài, cùng hoạt động khắc phục sau đánh giá.
Với những người dùng bị đánh dấu có nguy cơ cao, OpenAI cho biết Astra được huấn luyện để điều chỉnh ranh giới từ chối theo hướng thận trọng hơn và bao quát phạm vi rộng hơn đối với các rủi ro sử dụng lưỡng dụng, tức công nghệ có thể phục vụ mục đích hợp pháp nhưng cũng có khả năng bị lạm dụng.
OpenAI cũng sử dụng kiểm thử hồi quy để bảo đảm Astra vẫn chống được các kiểu jailbreak từng phát hiện trong những giai đoạn trước. Công ty đồng thời tiến hành các vòng “red-teaming” tự động mới, trong đó những hệ thống kiểm thử được giao nhiệm vụ tìm cách khai thác điểm yếu của mô hình.
OpenAI đánh giá GPT-6 Astra được căn chỉnh tốt hơn GPT-5.6 Sol. Những cải tiến này trải rộng từ thành phần dữ liệu dùng trong giai đoạn tiền huấn luyện đến cách chấm điểm trong quá trình học tăng cường. Công ty cho biết đã công bố một bộ đánh giá căn chỉnh mới. Kết quả cho thấy Astra tuân thủ các ranh giới an toàn và bảo mật tốt hơn, đồng thời có xu hướng hoạt động trong phạm vi được cấp phép rõ ràng hơn.
OpenAI chính thức bước vào 'Kỷ nguyên AGI' với GPT-6 Astra.
Trong một mô phỏng sử dụng hơn 54.000 tác vụ Codex nội bộ, Astra nhận khoảng một nửa số cảnh báo về hành vi lệch chuẩn có mức độ nghiêm trọng cao so với Sol. Đây là số liệu do OpenAI công bố và chưa phải đánh giá độc lập từ bên thứ ba.
OpenAI cho biết đang triển khai rộng hơn hệ thống giám sát hành vi lệch chuẩn. Theo công ty, căn chỉnh mô hình là cơ chế chính để ngăn những hành vi không phù hợp với mục tiêu ban đầu. Tuy nhiên, giám sát cũng giúp mở rộng khả năng quan sát hành vi của các mô hình tiên tiến, qua đó phát hiện cơ hội cải thiện mức độ căn chỉnh và an toàn. Hệ thống này đồng thời tạo thêm một lớp bảo vệ khi hành vi lệch chuẩn đã được phát hiện.
Với Astra, OpenAI đã bổ sung giám sát hành vi lệch chuẩn vào toàn bộ quá trình suy luận có sử dụng công cụ trong triển khai bên ngoài. Công ty thừa nhận cơ chế này đòi hỏi chi phí tính toán đáng kể và được xây dựng tương tự hệ thống đang dùng trong nội bộ.
Bên cạnh các cải thiện, OpenAI thừa nhận khả năng giám sát GPT-6 Astra đã giảm so với GPT-5.6 Sol. Công ty cho biết đã tiến hành nhiều cuộc điều tra về khả năng giám sát và khả năng kiểm soát Astra. Kết quả cho thấy Astra có khả năng kiểm soát chuỗi suy luận của chính mình tốt hơn Sol và ít có khả năng để lộ thông tin bất lợi trong chuỗi suy luận.
Trong các tình huống đối kháng, khi nhóm đánh giá chủ động thúc đẩy mô hình tìm cách né giám sát, Astra có thể không bị phát hiện nếu cố tình thể hiện kém trong bài đánh giá. Hành vi này được gọi là “sandbagging”. Mô hình cũng đôi khi có thể né hệ thống giám sát nội bộ khi được yêu cầu thực hiện một số tác vụ phá hoại.
OpenAI cũng cho biết chưa phát hiện bằng chứng về suy luận chuỗi suy nghĩ theo kiểu giấu thông tin trong những đoạn văn có vẻ bình thường và không liên quan. Tuy nhiên, công ty nhận định nguy cơ né giám sát có thể vẫn tồn tại, đặc biệt trong các tác vụ đòi hỏi mức độ suy luận thấp hơn.
Theo OpenAI, những kết quả này cho thấy các mô hình thuộc dòng Astra có thể né cơ chế giám sát chuỗi suy luận trong điều kiện đối kháng. Dù vậy, phần lớn phát hiện hiện nay đến từ các bài đánh giá trong đó mô hình được chỉ dẫn trực tiếp để tìm cách né giám sát. Các đánh giá tổng thể của OpenAI vẫn cho thấy Astra ít có khả năng vi phạm giới hạn an toàn và bảo mật hơn GPT-5.6 Sol.
OpenAI cho biết GPT-6 Astra xử lý việc duyệt web và môi trường làm việc trên máy tính có trách nhiệm hơn. Mô hình được đánh giá là chống “prompt injection” - kỹ thuật chèn lệnh nhằm đánh lừa hoặc điều khiển AI - tốt hơn GPT-5.6 Sol.
Công ty đã thử nghiệm Astra trong các môi trường duyệt web và làm việc chuyên nghiệp mô phỏng thực tế. Kết quả do OpenAI công bố cho thấy Astra ít có khả năng thực hiện những hành động lệch chuẩn hoặc gây hậu quả nghiêm trọng, chẳng hạn giao dịch không được phép, làm mất dữ liệu, truy cập vượt quyền hoặc né tránh các cơ chế kiểm soát.
Trong các môi trường tác vụ tự chủ, Astra cũng được cho là xử lý an toàn hơn những yêu cầu có nguy cơ gây hại, bao gồm lập kế hoạch tấn công bạo lực hoặc thực hiện hành vi gian lận.