OpenAIはGPT-6 Astraを発表し、これまでの最も優れたモデルとして人工知能技術における重要な進歩を遂げました。Greg Brockmanによって「能力の世代を超えた飛躍」と称されたAstraは、人工一般知能(AGI)を実現する最も近いモデルとされています。特に、これは人間の介入なしに安全なシステムに自律的にハッキングできる能力を持つ初めてのOpenAIモデルです。これらの進展により、GPT-6 Astra AGIはAI能力の進化における重要な発展と位置づけられています。
テストにおいて、GPT-6 AstraはExploitBenchで100%のスコアを記録しました。2回目の評価では、GoogleのV8 JavaScriptエンジンに関する最近の20件の脆弱性が使用されました。その評価では、Astraが前モデルのGPT-5.6 Solを上回り、2つの未知のゼロデイ脆弱性を発見し、それを連鎖させました。このモデルは、人間の監視なしに以前は知られていなかったソフトウェアの欠陥を独立して発見し、それらを連鎖させて硬化したシステムで機能するエクスプロイトに変える能力があると報告されています。
デモンストレーションでは、Astraが法的契約書を整形し、3Dゲームを制作し、食事オプションを探しながらテニスコートを予約しました。報告によると、AstraはKiCadでプリント基板を配置し、W-2フォームから税務申告を作成することができると言われています。さらに、Unityで3D都市シーンを構築できるとも報告されています。これらのデモと報告は、文書フォーマット、ソフトウェアやゲーム開発、スケジューリング、エレクトロニクス設計、税務作成、3Dシーン構築に適用される能力を示しています。
この要約は、GPT-6 Astraのテスト結果とデモンストレーションを報告したものです。ここでは、追加の説明や分析なしに、それらの結果を提示します。ここにはさらなる技術的詳細は含まれていません。
GPT-6 Astraの科学的評価には、素数間のギャップに関する数学的結果の改善が含まれています。このモデルは、生物学、化学、医学、物理学のテストで新しい記録を打ち立て、複数の科学分野にわたる結果が示されています。確認されていないリークによると、ARC-AGI3のベンチマークスコアは98.6%であるとされ、その数字は未確認のままです。この評価は、アストラのパフォーマンスに関する報告された評価の一部です。
アストラは、OpenAIの備えの枠組みの下で「重要」な閾値を超えました。アストラの自律性は、以前のシステムよりも監視を困難にし、評価はアストラが以前のモデルよりも追跡が難しいことを示しました。ヤクブ・パホッキは、会社はアクティベーションモニタリングを通じて、またはその思考の連鎖をより透明にすることで監視を強化すると述べました。これらの措置は計画された監視の変更として説明されています。
これらの評価結果と述べられた監視措置は、追加の分析なしに提示されています。ここではさらなる解釈は提供されていません。
OpenAIのGPT-6 Astraは、同社の最も能力の高いモデルとして提示され、報告では人工一般知能への一歩として説明されています。このモデルの高度な能力には、自律的なサイバー操作や広範な科学的パフォーマンスが含まれ、その自律性は以前のシステムよりも監視を困難にすることが報告されています。
OpenAIのスタッフ、特にヤクブ・パホッキは、モデルの思考の連鎖をより透明にすることやアクティベーションモニタリングを通じて監視を強化すると述べました。


