用户和测试者报告称,发布后的 GPT-6 Astra 似乎与发布时的表现相比智慧有所下降,测试中的直接比较显示输出效果更差。一些测试者观察到当前版本的回答速度更快,但响应的质量较低,并怀疑其计算能力降低。一周后,GPT-6 Astra 通过游戏引擎在逐街重建曼哈顿。
多位用户和测试者报告称 GPT-6 Astra 目前的表现好像比发布时更差,直接比较中称该模型显著变得更笨。测试者们报告称,虽然当前版本的某些回答比发布时更快,但这些输出的质量评估更差。一些测试者对模型的“计算能力”表示怀疑—一个指代模型在回答之前思考所花费计算努力的术语—可能已降低。
在控制的提示比较中,Salio 和 Md Ismail Sojal 在发布日实例的 Astra 和后期版本上运行相同的提示,并记录下后期版本的结果更差。这些用户报告和测试者观察集中在比较输出质量和响应时长上,而未具体说明内部变化。
发布的报告和测试比较总结了用户和测试者的这些感知和测量。报告中不包括性能变化的详细机制或明确归因。这些陈述源于用户报告和测试者比较。
术语“juice value”用作模型在答复之前思考所花费的计算努力的简写。这不是一个官方术语,也没有被正式定义。在讨论GPT-6 Astra的表现时,测试人员和观察者使用了这个简写,特别是在比较发布日模型和后续版本时。这些报告包括了具体的怀疑,即OpenAI在发布演示后降低了模型的juice value,一些人将其表述为这种计算努力的悄然减少。
审查GPT-6 Astra代码的Pranjal Paliwal评论说,模型的当前状态表明“我们没有AGI。我们有一个回归。”AGI代表人工通用智能,旨在执行人类能够完成的任何智力任务。GPT-6 Astra的发布中,OpenAI的总裁提到了AGI这一术语,突显了对模型的期望。这些声明捕捉了专家对Astra目前能力的某些意见,与其发布时的初衷进行了比较。
文章报道了用户和测试人员认为GPT-6 Astra自发布以来性能下降,描述该模型在直接比较中显得明显更笨。
观察者报告称后续版本反应时间更快,但输出质量被评估为更差,并怀疑模型的“juice value”——即模型在回答之前所花费的计算努力——可能已被降低;Salio和Md Ismail Sojal对发布日和后续版本进行了相同的提示测试,并记录下后续版本的结果更差。
报道还包括Pranjal Paliwal的代码审查结论,即该版本构成回归而非AGI,并提到OpenAI的总裁在Astra发布时使用了AGI这一术语。


