返回首页 >

AGI时代来了?GPT-6发布:“能干活”也“看得住” ,称目前智能水平最高模型

2026-09-04 09:48   澎湃新闻

  在OSWorld 2.0测试中,Astra得分72.6%,GPT-5.6 Sol为65.7%;在延迟模拟环境下,Astra完成一项任务平均约需40分钟,而GPT-5.6 Sol约需75分钟,OpenAI据此称Astra完成任务所需时间约减少47%。

  在Mind2Web测试中,结合更新后的Codex harness后,Astra的任务完成速度达到当前GPT-5.6 Sol体验的1.9倍。

在OSWorld 2.0测试中,Astra得分72.6%。

  奥特曼在接受外媒采访时表示,Astra在主观体验上与此前任何模型都非常不同,这是第一个让他觉得可以放心让用户直接“试一试”的模型。用户可以让Astra构建复杂互动软件、开发电脑游戏、进行DIY电子工程、运行科学模拟,甚至制作财务模型并同步生成PPT演示文稿。

  OpenAI表示,Astra将复杂推理与多步骤工作流结合起来,可以直接生成和处理文档、电子表格和演示文稿,并能够遵循已有模板、调整页面布局,同时尽可能只提取与任务相关的信息。

  OpenAI公布的Professional评测中,Astra在AutomationBench取得41.4%,GPT-5.6 Sol为18.1%;在BenchCAD中分别为95.9%和83.3%;在BrowseComp中分别为91.5%和90.4%。

  这些指标分别覆盖自动化任务、计算机辅助设计以及网络信息检索等不同工作场景。其中,AutomationBench的差距尤其明显。Astra的成绩达到41.4%,GPT-5.6 Sol为18.1%。

  OpenAI公布的企业案例也显示,Astra正在被用于更加接近真实生产流程的任务。

猜你喜欢

热点新闻

{$loop_num=0}