AGI 真来了、Astra 唯一的神、Astra 把 Fable 斩杀了……
在过去的两三天,几乎所有的社交平台都充斥着对 GPT-6 Astra 的溢美之词,看上去 OpenAI 仿佛一扫被 Claude Fable 压着打了半年的阴霾,成功打了一场翻身仗。

但事实真的如此吗?
说实话,老狐在看到 GPT-6 Astra 的介绍文章时,也有一种仿佛看到「原子弹在眼前爆炸」的感觉,仅从数据上来看,GPT-6 Astra 不但与 Claude Fable 在大部分测试基准上互有胜负,而且还在许多测试项目上超越了 Fable。

不过老狐相信许多朋友也和我有同样的疑惑:GPT-6 Astra 真的有那么强吗?
所以今天就让老狐用 3 个真实场景的测试,带着大家一起体验一下 GPT-6 Astra 到底有没有 OpenAI 宣称的那么强大。

测试标准
按照 OpenAI 员工 Tibo 的说法,GPT-6 Astra 的 Light 和 Medium 档位已经足够出色,甚至比 High 级别表现更好,且考虑到许多朋友反馈说 Medium 是使用 GPT-6 Astra 最合适的推理档位。

所以本期评测统一采用 GPT-6 Astra Medium 进行,在 OpenAI 官方的 ChatGPT/Codex 客户端中进行测试。
同时。为了尽可能测试 GPT-6 Astra 是否真的如 OpenAI 所说具有那么强的自主完成工作的能力,所以,本次所有的任务都将遵守 0 人工参与的原则。

一句话生成可玩的太空战机游戏
许多朋友可能已经看过了许多使用 GPT-6 Astra 生成《我的世界》和《马里奥赛车》游戏的视频。
但是为了避免 OpenAI 针对这两个最常见的测试场景进行专项强化训练,所以老狐今天给大家看一个不一样的~

没错,就是太空战机 3D 版。
本次的测试重点在于两方面,一方面是游戏画面是否有「太空感」,战机模型的真实性,另一方面则是考验模型对游戏机制的还原度和可玩性。

在等 GPT-6 Astra 默默工作了 18 分钟后,让我们一起来看一下它的成果如何。

仅从画面的氛围感表现来说,背景里不断随着视角而流动的星星,的确会给人一种太空的氛围,但是一旦将目光聚焦到战机和敌人模型上,就会一秒出戏,像是在玩非常低劣的山寨太空战机游戏。
如果再直接一点来说,老狐觉得这样的画面甚至不如 20 年前的红白机游戏……
那么让我们把视线转回到游戏机制的实现方面。

相比表现惨不忍睹的游戏画面,GPT-6 Astra 在游戏机制的还原度上做得可以说是相当不错。
不但基础的移动、射击完全没有任何问题,而且在相对困难的模型碰撞掉血与火力强化道具机制方面,也完整地实现了预期的效果。

同时,Boss 不但具有独立的血条,而且还拥有独立的双发攻击模式,玩家死亡之后也可以重新开始游戏。
所以,如果让我们给 GPT-6 Astra 的“一句话生成游戏”能力做一个总结,我觉得它的核心问题不是做不出游戏,而是游戏能玩,但是距离真正的商业游戏,它在美术方面仍然有着非常大的差距,而且视觉审美也是 GPT 一直以来的痛点,这一点目前来说还是它比较大的硬伤。

按照模版生成 PPT 汇报文件
OpenAI 在发布 GPT-6 Astra 时,特地强调了它遵循已有企业模板生成内容的能力,简单来说,就是能遵循已有的企业文件规范(比如 PPT 模板)生成一致性更强的文件。
这意味着不再需要 AI 先生成,人工再按照模板手动调整设计排版了,但是 GPT-6 Astra 真的能做到吗?
所以第二个测试,就是测试 GPT-6 Astra 能否真的按照给到的 PPT 模板生成 PPT 汇报文件,同时为了给 GPT-6 Astra 上点难度,老狐还在接近 400 行的 Excel 报表文件里掺入了大量的重复数据、异常数据和删除了许多字段的一些数据,看看 GPT-6 Astra 能不能同时检查出资料文件中的错误、异常数据。

接下来,老狐就将下面的提示词与资料文件一起发送给了 GPT-6 Astra,在等待了约 8 分 20 秒后,它完成了任务。

我们先看本次最核心的内容:GPT-6 Astra 有没有找出我们故意给错的数据?

找到了!
而且 GPT-6 Astra 还将每一笔订单中重复订单的金额、异常折扣订单的金额,以及缺少的字段内容都统计了出来,所以可以说 GPT-6 Astra 在做汇报文件的时候,并不是单纯机械地生成文件,而是会判断数据的真实性、准确性,在这方面,我觉得可以给 GPT-6 Astra 一个很高的评价。
接下来,让我们看一看 GPT-6 Astra 是否能够按照模板交付文件。
本次的模板看上去比较简单,但是老狐也埋了一些坑,比如左下角专门设计了数据来源区域,检查 AI 能否发现并正确填写,图表的配色是否符合整体的蓝调风格。

那么 GPT-6 Astra 做得怎么样呢?
答案依然是:非常不错。

GPT-6 Astra 不但完全遵守了模板的设计规范,没有擅自调整标题和子标题的位置,而且在数据来源方面也标记得非常准确。
整体的配色风格依然是以蓝色为主,没有擅自加入其他冲突的颜色,所以在模板遵循度方面,老狐认为 GPT-6 Astra 做得的确非常出色。
实话实说,这一环节最让老狐感到意外的,并不是 GPT-6 Astra 在模板遵循度方面的表现有多么出色,而是它竟然能够先理解并找出一堆混乱数据中错误的内容,再按照已有的规范,交付一个完全能够拿去开会的成品,这一点是我认为它是一个聪明模型的最主要原因。

自主修复记账App
第三项测试,我们继续上强度。
这一次,老狐不会告诉 GPT-6 Astra 这个记账 APP 到底有哪些界面问题、哪些 bug,只会告诉它目前还有一些未知的问题,让它自己测试,完成所有 bug 的修复,看看它能不能自主完成修复。

在安排 GPT-6 Astra 开始之前,我们先来看一下目前这个记账 APP 的问题:
老狐在 App 内一共埋了 6 个问题:包括:
- 数据刷新后丢失
2.总支出计算逻辑错误,所有记录都算到了支出里面
3.结余计算错误
4.数据筛选功能不可用
- 深色模式下,文字颜色过暗,完全看不清
- 没有数据的时候,界面不是居中展示

在经历了 9 分 47 秒的等待之后,GPT-6 Astra 完成了修复。

可以看到,GPT 不但自主运行项目,并在测试后检查并修复了老狐预先埋下的 6 个问题,而且还解决了手机端数据溢出以及增加了保存失败时数据防丢失功能。

从它的修复过程中可以看到,它并不是上来直接修改代码,而是先启动项目,在浏览器中就像真人一样一边操作、截图、查看问题,发现问题之后修改代码,再重新刷新页面进行验证。

从这项测试中,老狐直观地感受到,GPT-6 Astra 在处理问题上越来越像一个真正的工程师,而不是一个被动接手任务去修改代码的简单助手,从运行、发现问题、修改再到测试,这个循环是高度自主化的,无需人工参与。

总结
总的来说,本次的 3 轮测试中,除了视觉审美方面依然是 GPT-6 Astra 比较薄弱的地方,在其他任务中,尤其是自主检测记账 App bug 并完成修复,以及自主完成游戏功能的开发,这两方面都体现出了它本次升级最大的一点提升:高度自主化的工作能力。

老狐认为这次 GPT-6 Astra 的发布,或许会意味着一个 AI Agent 高度自主化工作时代的开始。以往我们是人在工作中占主体,而如今,或许人只需要为 AI Agent 赋予一项职责,然后它就会自主去完成职责范围之内的所有任务。
但是也不得不说,目前 GPT-6 Astra 的价格仍然非常昂贵,每百万Token 的输出价格是 50 美元,收入是 10 美元,是 GPT-5.6 Sol 的2.5 倍,因此对于大部分日常Agent 工作来说,使用它的成本还是太高,不太划算。
所以老狐认为,目前除了极其复杂的任务需要使用 GPT-6 Astra,对于大部分任务来说,使用性能不错且价格不贵的模型,性价比会更高。

深耕十余年的科技媒体,近千万读者的兴趣栖息地,每日跟踪科技、数码、AI、新能源、热点等重磅内容,专注于每日为大家提供更新鲜、前沿、专业、发展的热点科技报道,欢迎关注@科技狐!