OpenAI đã phát hành GPT-6 Astra, đánh dấu một bước tiến quan trọng trong công nghệ trí tuệ nhân tạo với mô hình mạnh mẽ nhất đến nay. Được Greg Brockman gọi là “bước nhảy thế hệ về khả năng”, Astra được ca ngợi là mô hình gần gũi nhất với việc đạt được trí tuệ nhân tạo tổng quát (AGI). Đáng chú ý, đây là mô hình đầu tiên của OpenAI được cho là có khả năng tự động xâm nhập vào các hệ thống bảo mật mà không cần sự can thiệp của con người. Những tiến bộ này đặt GPT-6 Astra AGI ở vị trí phát triển quan trọng trong sự tiến hóa của khả năng AI.
Trong các thử nghiệm, GPT-6 Astra đạt 100% điểm trên ExploitBench. Một đánh giá thứ hai sử dụng 20 lỗ hổng gần đây trong động cơ JavaScript V8 của Google. Trong đánh giá đó, Astra đã vượt qua người tiền nhiệm của nó, GPT-5.6 Sol, và phát hiện và liên kết hai lỗ hổng zero-day chưa từng được biết đến trước đó. Mô hình này được báo cáo có khả năng khám phá độc lập các lỗi phần mềm chưa được biết đến trước đó và liên kết chúng thành các khai thác hoạt động trên các hệ thống bảo mật mà không cần kiểm soát từng bước của con người.
Trong các buổi trình diễn, Astra đã định dạng một hợp đồng pháp lý, xây dựng một trò chơi 3D và đặt chỗ một sân quần vợt trong khi tìm kiếm các lựa chọn ẩm thực. Các báo cáo cho biết nó có thể bố trí một bảng mạch in trong KiCad và soạn thảo một mẫu thuế từ một mẫu W-2. Các báo cáo cũng cho biết nó có thể xây dựng một cảnh thành phố 3D trong Unity. Những buổi trình diễn và báo cáo này cho thấy các khả năng áp dụng trong định dạng tài liệu, phát triển phần mềm và trò chơi, lập lịch, thiết kế điện tử, soạn thảo thuế và xây dựng cảnh 3D.
Tóm tắt này liệt kê các kết quả thử nghiệm và buổi trình diễn đã được báo cáo cho GPT-6 Astra. Nó trình bày những kết quả đó mà không có giải thích hay phân tích bổ sung. Không có chi tiết kỹ thuật nào được bao gồm ở đây.
Các đánh giá khoa học về GPT-6 Astra đã bao gồm sự cải thiện trong kết quả toán học về các khoảng cách giữa các số nguyên tố. Mô hình đã thiết lập các điểm mốc mới trong các bài kiểm tra về sinh học, hóa học, y học và vật lý, trải rộng qua nhiều lĩnh vực khoa học. Các rò rỉ chưa được xác nhận cho thấy điểm chuẩn ARC-AGI3 ở mức 98,6%, và các số liệu rò rỉ đó vẫn chưa được xác nhận. Các đánh giá này là một phần của báo cáo đánh giá hiệu suất của Astra.
Astra đã vượt qua ngưỡng “quan trọng” theo Khung Đánh giá Chuẩn bị của OpenAI. Tính tự động của Astra làm cho việc giám sát trở nên khó khăn hơn so với các hệ thống trước đó, và các đánh giá cho thấy Astra khó theo dõi hơn so với các mô hình trước. Jakub Pachocki cho biết công ty sẽ tăng cường giám sát thông qua giám sát kích hoạt hoặc bằng cách làm cho chuỗi suy nghĩ của mình minh bạch hơn. Những bước này được mô tả như là những thay đổi trong kế hoạch giám sát.
Các kết quả đánh giá và các biện pháp giám sát đã được nêu ra mà không có phân tích bổ sung. Không có giải thích thêm nào được cung cấp ở đây.
GPT-6 Astra của OpenAI được giới thiệu là mô hình mạnh mẽ nhất của công ty cho đến nay và được mô tả trong báo cáo là một bước tiến toward trí tuệ nhân tạo tổng quát. Các khả năng tiến bộ của mô hình bao gồm các hoạt động mạng tự động và hiệu suất khoa học rộng lớn, và sự tự động của nó đã được báo cáo là làm cho việc giám sát khó khăn hơn so với các hệ thống trước đó.
Nhân viên của OpenAI, bao gồm cả Jakub Pachocki, cho biết công ty sẽ tăng cường giám sát qua giám sát kích hoạt hoặc bằng cách làm cho chuỗi suy nghĩ của mô hình minh bạch hơn.


