很多朋友不知道【GPT-6 Astra发布 “数字员工”离我们又近了一步】,今天小绿就为大家解答一下。
更守规矩,却没有以前那么好读

如果Astra能用几美元完成一项原本需要员工忙上几个小时的工作,即便单次调用价格更高,企业也可能愿意买单。模型之间的比较,也会从“每百万token多少钱”转向“完成一件合格的工作要多少钱”。
让AI写一封邮件、整理会议纪要、查找资料,或者给出一份方案。它的回答越来越像一名熟练员工,却始终隔着最后一步:AI负责告诉你怎么做,剩下的操作仍然要由人来完成。 现在的大模型已经很会说了。影响企业是否愿意继续花钱的,不是回答能不能再长一点,而是AI能不能离开聊天框,进入公司每天都在使用的系统。 问题出在监督手段上。当前评测里的Astra更守规矩,研究人员却比以前更难从它的推理记录中提前发现问题。今天测出来的安全表现不错,不代表同一套监控方法能够一直跟上模型能力。 更现实的情况是,AI已经从一个提供建议的人,变成了一个准备亲自动手的人。 GPT-6 Astra是不是AGI,还可以继续争论。 Anthropic已经依靠编程能力、长任务表现和企业客户建立了优势。OpenAI拥有庞大的ChatGPT用户,但想进入企业的核心业务,仅靠聊天机器人还不够。
电脑操作能力给了OpenAI另一条路。 这里的“端到端”,其实比“最强模型”更能说明OpenAI的打算。企业不会只计算一次对话用了多少token。它们更关心一项工作需要多少时间、多少人工复核,以及失败以后要不要重做。OpenAI想要的不只是订阅费
GPT-6 Astra试图跨过这一步。 按照OpenAI的介绍,Astra可以填写在线表格、更新CRM里的客户资料、整理日历、搜索网页、处理邮件和文档。 Astra在一些电脑操作测试中的进步很明显。在Agents’ Last Exam上,它取得59.3%的成绩,高于GPT-5.6 Sol的53.6%和Claude Opus 5的55.5%;完成同类任务时,输出token比Claude Opus 5少约65%。 Astra在安全测试中更愿意遵守限制,它的思维过程却比前代模型更难监控。 网络安全行业面对的压力更加直接。AI可以更快发现漏洞,也能更快制造攻击工具。安全竞争会从“谁先找到漏洞”,慢慢变成“谁能更快修复、部署和验证”。 OpenAI表示,Astra的思维链更短,也更少出现能够暴露异常行为的信息。在一些专门设计的对抗测试中,当研究人员要求它躲避监控时,它有时能够绕过只检查思维链的监控器。OpenAI没有发现Astra在普通使用环境中主动隐藏意图的证据,情况还没有严重到“模型学会欺骗人类”。
过去两年,我们已经习惯把工作丢进聊天框。 它的API价格并不便宜:每百万输入token 10美元,输出token 50美元,拥有105万token的上下文窗口,最多可以输出12.8万token。 这已经很接近人们想象中的“数字员工”。 过去的软件界面主要为人设计,今后还得考虑智能体能不能识别按钮、理解页面状态、发现操作失败。与此同时,网站也要区分正常的AI代理、批量自动化工具和恶意机器人。AI正在从“会说”走向“会做” 当它拿起鼠标,错误就会留在现实世界里。版权所有,未经许可不得转载 英国AI安全研究所还测试了模拟供应链攻击、虚假身份,以及诱导他人接受恶意代码等场景。测试没有接入真实网络和代码仓库,不能直接当成一次现实攻击,但已经足以提醒企业:部署智能体时,最难做的决定不是选哪个模型,而是给它开放哪些权限。 人的位置会向前后两端移动。一端是决定AI应该做什么、能做到哪一步;另一端是检查结果、处理例外,并在出现问题以后找到责任人。 很多企业仍在使用老旧的财务软件、后台系统和内部网页。这些系统没有方便的API,也不可能全部为AI重写。Astra可以直接识别界面、点击按钮、填写字段,像一名员工那样使用它们。 对普通知识工作者来说,短期内先被压缩的可能不是整个岗位,而是工作中那些最琐碎的步骤:找资料、录数据、制作初稿、调整格式、在几个软件之间搬运信息。 身份验证、授权范围和操作记录,会成为智能体产品的基础设施。 “数字员工”还没有完全到来,但它离真实的工作环境,已经比过去近了不少。 在OSWorld 2.0电脑操作测试中,Astra取得72.6%的成绩,平均完成时间约为40分钟。GPT-5.6 Sol的成绩是65.7%,平均需要约75分钟。 过去,大模型说错一句话,用户还可以直接划走。 用户不再需要把一个任务拆成十几条指令,分别交给不同工具。只要告诉Astra想要什么,它便会自己寻找入口、切换页面,完成中间那些琐碎的操作。 Astra普及以后,网页和桌面软件可能迎来一轮新的改造。 按照OpenAI的介绍,Astra不仅能理解任务,还可以打开浏览器、操作桌面软件、填写表格、更新CRM里的客户资料,再把处理结果写进邮件和文档。在工程场景中,它还能安装软件、运行测试、制作网站,甚至打开KiCad完成电路板布局。 企业围绕模型重新安排权限、审批和审计以后,更换模型就不再是改一个API地址那么简单。OpenAI得到的也不只是一笔调用收入,还可能是整套工作流的入口。 Astra最突出的地方,不是每一道题都拿第一,而是把推理和操作接到了一起。以前,AI可以告诉你如何制作一张表格、修改公司后台、部署一个网站,最后还得有人照着答案操作。Astra试图把鼠标和键盘也接过去。 它不会坐在办公室里,也没有自己的工位,却能使用公司每天都在使用的软件,接手过去必须由员工逐项完成的工作。相比模型又学会了多少知识、基准成绩提高了几个百分点,这种变化更容易被企业感受到。
这次升级,重点不在聊天 如果Astra成功,OpenAI拿到的将是一个远大于聊天订阅的企业自动化市场。如果它犯错,留下的也不会只是一段不准确的回答,还可能是一条被修改的记录、一份部署错误的代码、一笔不该发出的交易,或者一个尚未公开的漏洞。 OpenAI联合创始人格雷格·布罗克曼把Astra称为AGI时代的开端。但就在几天前,萨姆·奥尔特曼还说,AGI已经成为一个定义混乱、甚至带有营销色彩的词。 它还能安装软件、运行测试、排查电脑故障。在工程场景里,Astra可以打开KiCad进行电路板布局,调用数据分析工具生成图表,也可以制作网站,再跑一遍前端质量检查。 GPT-6 Astra首先向一部分机构开放,随后进入ChatGPT Plus、Pro、Business和Enterprise,并通过API和AWS提供。 所以,OpenAI所谓“全球最聪明的模型”,仍然是发布会语言。测试工具、推理预算和任务类型稍有不同,排名就可能发生变化。 Astra是不是AGI,可以留给研究人员继续争论。对普通用户和企业来说,一个更直接的变化已经发生:AI开始从“会回答问题”,走向“能把事情办完”。 但Astra也没有在所有测试中领先。在带工具的Humanity’s Last Exam上,它的57.2%低于Claude Fable 5.1的65%;Artificial Analysis Intelligence Index上,Astra同样落后于两款Claude模型。
以上问题已经回答了。如果你想了解更多,请关
新经网网站 (
https://www.xinhuatone.com/)