传媒行业AI系列专题研究:GPT 6 Astra,Computer Use突破,AI从Copilot迈向端到端Agent
摘要公开阅读;PDF 仅限有效会员阅读与下载,所有会员权限相同。 邮件登录
摘要
国信证券传媒·计算机团队发布AI系列专题报告,认为OpenAI发布的GPT-6 Astra使模型从“会回答”走向“能完成工作”,AI应用与Inference需求有望进入新阶段,维持行业“优于大市”评级。 Astra在FrontierMath Tier 4达到约98%(上代GPT-5.6 Sol为83.0%)、ARC-AGI-3达到99.9%(上代7.8%),Terminal-Bench 4.0由37.3%升至57.9%,AutomationBench由18.1%升至41.4%,MRCR 512K–1M由73.8%升至96.3%。 本轮最重要突破来自Computer Use:OSWorld 2.0得分由65.7%提升至72.6%,模拟单任务耗时由约75分钟降至40分钟,结合新一代Codex Agent Harness后Mind2Web任务完成速度约达上一代1.9倍;Astra还成为OpenAI首个达到Cybersecurity“Critical”等级的模型,ExploitBench达100%(上代78.5%),并在内部测试中发现并利用2个此前未知的Zero-day漏洞。 报告判断模型竞争指标将从单Token价格转向Task Completion Rate、单任务成本、执行时间及人工干预次数,AI由“生成中间内容”走向“直接交付结果”。 产业影响上,软件开发与企业SaaS率先进入Agentic阶段,交互方式由“用户→SaaS UI”演化为“用户→Agent→多个软件/API”,竞争壁垒从UI和Seat数量转向Data、Workflow与Permission,商业模式或向Consumption、Agent Seat及Outcome-based Pricing迁移。 Agent将计算需求从“人类调用”升级为“自主循环调用”,单任务模型调用次数可能由个位数升至几十甚至数百次,即使单位Token成本下降,Inference需求天花板仍有望继续打开,GPU/ASIC、HBM、网络与光模块、数据中心及电力等基础设施为确定性最高的受益环节,应用侧关注Coding、企业办公、SaaS、安全及专业知识工作场景。
主要观点
- GPT-6 Astra能力继续跃升,模型从“会回答”走向“能完成工作”,在部分复杂Agent及软件工程任务中以更少输出Token、更高成功率完成任务
- 能力跃迁对比全面:Terminal-Bench 4.0由37.3%升至57.9%,AutomationBench由18.1%升至41.4%,MRCR 512K–1M由73.8%升至96.3%,OSWorld 2.0由65.7%升至72.6%
- 模型效率评价体系有望从单Token价格转向单任务成本:Astra API单Token价格虽高于GPT-5.6 Sol,但完成一个有效任务的综合成本反而可以下降
- Computer Use迎来代际升级:Astra可直接操作浏览器及计算机界面,完成网页表单、CRM更新、日历管理、数据分析、软件安装测试等任务;OSWorld 2.0提升6.9pct,ScreenSpot-Pro提升15.8pct至92.7%,单任务耗时由约75分钟降至约40分钟(-47%),Mind2Web速度约1.9倍
- 专业工作能力增强,Agent评价指标有望从回答准确率转向Task Completion Rate:Astra可在同一任务中完成检索、分析、软件操作并制作Word/Excel/PPT最终交付物,遵循企业模板与业务规则,人更多负责目标设定、审核和例外处理
- Cyber首次进入Critical等级:Astra成为OpenAI首个在Preparedness Framework中达到Cybersecurity “Critical”的模型,ExploitBench达100%(GPT-5.6 Sol为78.5%),内部测试中发现并利用2个此前未知Zero-day漏洞;AI Self-Improvement仍低于High门槛,Critical不等于AGI或RSI
- 软件开发可能成为最早被Agent深度重构的行业:AI覆盖价值链由Coding向需求理解、开发、测试、Debug、浏览器验证及部署扩展,软件工程人均产出有望提升,简单开发和外包业务可能承受价格压力
- 企业软件交互演化为“用户→Agent→多个软件/API”:拥有核心数据、深度Workflow、权限及Agent Orchestration能力的平台型厂商优势强化,依赖Per-seat收费、缺乏数据与流程壁垒的软件面临Seat压缩,商业模式向Consumption、Agent Seat乃至Outcome-based Pricing迁移
- Agent将AI计算需求从“人类调用”升级为“自主循环调用”:单任务背后的模型调用次数可能由个位数提升至几十甚至数百次,任务持续时间由秒级/分钟级向数十分钟延伸,即使单位Token成本下降,整体Inference Compute需求仍有望较快增长
- 投资观点:Inference基础设施仍是当前确定性最高的方向,Agent应用具备更大中长期弹性;应用侧重点关注Coding、企业办公、SaaS、安全及专业知识工作,软件开发有望最早实现规模化渗透
- 风险提示涵盖:大模型能力提升及Agent技术进展低于预期、Agent商业化及企业渗透低于预期、AI推理算力需求增长低于预期、AI应用商业模式及付费意愿低于预期、软件行业竞争格局变化、AI安全权限及监管趋严、技术路线判断不确定性
论述逻辑
- OpenAI发布GPT-6 Astra → 数学/科学/软件工程Benchmark全面跃升(FrontierMath Tier 4约98%、ARC-AGI-3达99.9%)且Computer Use、长周期任务、工具调用能力同步升级 → 模型从单轮问答走向复杂问题解决,竞争指标由Benchmark与单Token价格转向Task Completion Rate、单任务成本、执行时间与人工干预次数 → 产业端软件开发与企业SaaS率先进入Agentic阶段:交互由“用户→SaaS UI”变为“用户→Agent→多个软件/API”,壁垒转向Data、Workflow与Permission,Per-seat模式或向Consumption/Agent Seat/Outcome-based Pricing迁移 → Agent自主循环调用使单任务模型调用次数由个位数升至几十甚至数百次,即使单位Token成本下降,Inference Compute需求仍有望较快增长 → 投资顺序上基础设施(GPU/ASIC、HBM、网络与光模块、数据中心及电力)确定性最高、Agent应用中长期弹性更大 → 维持传媒·计算机行业“优于大市”评级
关键展望
- 未来2-3年AI产业核心主线将从“谁拥有最好的Chatbot”逐步转向“谁能够让AI安全、稳定、低成本地完成最多真实世界任务”,Agent有望同时成为AI应用商业化和推理算力需求增长的重要驱动力
- 企业软件商业模式可能由传统Per-seat Subscription向Consumption、Agent Seat以及Outcome-based Pricing迁移,入口重要性部分下降,数据、Workflow、权限与Agent Orchestration重要性上升
- 受益顺序:Inference基础设施为当前确定性最高方向,Agent应用具备更大中长期弹性;软件开发因任务数字化程度高、验证标准明确、工具链成熟,有望成为Agent最早实现规模化渗透的行业之一
- 报告明确列示风险:若Agent在真实业务流程中的Task Completion Rate、成本效率或可靠性改善不及预期,企业可能继续以Copilot等低自治形态部署AI;若推理效率优化快于任务量增长,Agent对算力需求的拉动可能低于预期;监管趋严或Human-in-the-loop要求提高可能降低Agent自主程度
推荐标的
- 报告未明确给出推荐标的(个股);行业投资评级为优于大市(维持)
- 产业链受益方向:GPU/ASIC、HBM、网络与光模块、数据中心及电力等Inference基础设施环节确定性最高;应用侧重点关注Coding、企业办公、SaaS、安全以及专业知识工作等高价值场景