长城证券 传媒行业:GPT 6 Astra发布,前沿模型能力持续提升
摘要公开阅读;PDF 仅限有效会员阅读与下载,所有会员权限相同。 邮件登录
摘要
长城证券发布传媒行业动态点评,维持行业“强于大市”评级。 OpenAI 于 9 月 4 日正式发布 GPT-6 Astra,该模型集中了其在预训练、强化学习和对齐上的研究成果,在电脑操作、浏览器使用、软件工程、网络安全、科学研究和专业工作等领域全面刷新此前模型能力。 定价方面,Astra 标准 API 缓存输入/输入价格分别为 1/10(美元/百万 Token)、缓存写入价格为 12.5 美元/百万 Token、输出价格为 50 美元/百万 Token,输入和输出价格均为 GPT-5.6 Sol 的 2.5 倍,与 Claude Fable 5 相近。 基准测试上,Astra 在 OSWorld 2.0 得分 72.6%、AutomationBench 得分 41.4%、FrontierMath Tier 4 取得 97.6%、Terminal-Bench 4.0 得分 57.9%、ExploitBench 评分达 100%,并在 ARC-AGI-3 测试中评分高达 99.9%、大幅超越 GPT-5.6 Sol 的 7.8%。 报告认为 Astra 打造了完整的端到端执行能力,模型规划能力维持快速提升,带动 AI 可承担任务复杂度上限快速提升。 投资层面,报告建议关注应用端(Salesforce 与 Anthropic 扩大合作推出 Claudeforce,Agentforce 及 Data 360 合计 ARR 接近 39 亿美元、同比增长 210%以上)与云计算(模型分层策略带动话语权向下游 CSP 迁移、杰文斯悖论带动云需求总量爆发增长)布局机会,相关标的包括迈富时、阜博集团、快手等 AI 应用公司以及阿里巴巴、腾讯控股、金山云等云计算/算力租赁公司。
主要观点
- OpenAI 于 9 月 4 日正式发布 GPT-6 Astra,该模型在电脑操作、浏览器使用、软件工程、网络安全、科学研究和专业工作等领域全面刷新此前模型能力。
- GPT-6 Astra 定价显著提升:Astra 标准 API 缓存输入/输入价格分别为 1/10(美元/百万 Token)、缓存写入价格为 12.5 美元/百万 Token、输出价格为 50 美元/百万 Token,输入和输出价格均为 GPT-5.6 Sol 的 2.5 倍,与 Claude Fable 5 相近。
- Astra 新增异步工具调用、任务执行过程中的指令调整,以及在保留缓存的同时动态改变推理强度;Codex 还将试验跨上下文窗口保存笔记和检索历史内容,提升长周期 Agent 任务的连续性。
- 电脑操作能力显著增强:Astra 在 OSWorld 2.0 上得分 72.6%,高于 GPT-5.6 Sol 的 65.7%,单项任务耗时降低约 47%;在专业流程测试 AutomationBench 上得分 41.4%,较 GPT-5.6 Sol 的 18.1% 提升明显。
- 科学推理与编程能力提升:GPT-6 Astra 在 FrontierMath Tier 4 上取得 97.6% 并协助研究人员改进两项长期未突破的素数间隔问题;在 Terminal-Bench 4.0 上得分 57.9%,高于 GPT-5.6 Sol 的 37.3% 和 Claude Fable 5.1 的 55.8%;在 ExploitBench 上评分达 100%。
- GPT-6 Astra 在 ARC-AGI-3 测试中评分高达 99.9%,大幅超越 GPT-5.6 Sol 的 7.8%;在 96% 的测试关卡中使用的行动次数少于受测人类的中位数,行动效率达到甚至超过人类基准。
- 报告认为 ARC-AGI-3 测试核心是 AI 面对从未见过的环境时,能否通过探索、交互和试错自行理解规则、发现目标并解决问题;尽管 Standard harness 与 Provider Adaptive harness 结果存在差异,Astra 模型规划能力客观上维持快速提升,带动 AI 可承担任务复杂度上限快速提升。
- 应用端验证 SaaS 作为 AI 调用底座的价值:Salesforce 业绩超预期,AI 业务 Agentforce 及 Data 360 合计 ARR 接近 39 亿美元、同比增长 210%以上,宣布与 Anthropic 扩大合作并推出 Claudeforce。
- 云计算方面,随开放权重模型能力快速提升,云厂商可依据客户对质量、延迟、成本等要求提供对应模型,模型分层策略带动产业话语权由头部模型厂商向下游 CSP 迁移。
- 随着 AI 实际使用成本(cost/Mtok)大幅下降,在成本端具备经济效益之后,杰文斯悖论将带动云需求总量步入爆发增长阶段。
- 相关标的分两条主线:AI 应用(迈富时、阜博集团、焦点科技、巨人网络、恺英网络、赤子城科技、第四范式、快手);云计算/算力租赁(阿里巴巴、腾讯控股、金山云、粤港湾智算、协创数据、利通电子)。
- 风险提示涵盖四项:AI 应用商业化不及预期;AI 吞噬 SaaS 叙事持续;AI 技术发展不及预期;AI 应用公司业绩不及预期。
论述逻辑
- OpenAI 发布 GPT-6 Astra → OSWorld 2.0、AutomationBench、FrontierMath Tier 4、Terminal-Bench 4.0、ExploitBench、ARC-AGI-3 等基准成绩全面领先 → Astra 整合电脑及软件操作、推理、安全判断等能力,打造完整的端到端执行能力,AI 可承担任务复杂度上限快速提升。
- 模型能力持续提升 → Salesforce 与 Anthropic 扩大合作并推出 Claudeforce,将 Claude 模型能力与 Salesforce 企业数据、业务逻辑、操作能力及权限治理体系结合 → 应用软件未来或将成为模型厂商生态合作方,验证 SaaS 作为 AI 调用底座的价值。
- 开放权重模型能力快速提升 → 云厂商可依据客户对质量、延迟、成本要求提供对应模型 → 模型分层策略带动产业话语权由头部模型厂商向下游 CSP 迁移。
- AI 实际使用成本(cost/Mtok)大幅下降 → 云计算在成本端具备经济效益 → 杰文斯悖论带动云需求总量步入爆发增长阶段 → 报告建议关注应用以及云计算布局机会。
关键展望
- Codex 将试验跨上下文窗口保存笔记和检索历史内容,进一步提升长周期 Agent 任务的连续性。
- Salesforce 与 Anthropic 扩大合作并推出 Claudeforce,报告认为应用软件未来或将成为模型厂商生态合作方。
- 模型分层策略带动产业话语权由头部模型厂商向下游 CSP 迁移,杰文斯悖论将带动云需求总量步入爆发增长阶段。
- 报告未给出个股目标价或量化时间窗口,仅列示风险提示:AI 应用商业化不及预期、AI 吞噬 SaaS 叙事持续、AI 技术发展不及预期、AI 应用公司业绩不及预期。
推荐标的
- 行业评级:传媒“强于大市”(维持评级)。
- AI 应用相关标的:迈富时、阜博集团、焦点科技、巨人网络、恺英网络、赤子城科技、第四范式、快手(报告未列个股评级与目标价)。
- 云计算/算力租赁相关标的:阿里巴巴、腾讯控股、金山云、粤港湾智算、协创数据、利通电子(报告未列个股评级与目标价)。
- 海外提及公司:Salesforce,业绩超预期,Agentforce 及 Data 360 合计 ARR 接近 39 亿美元、同比增长 210%以上,与 Anthropic 扩大合作并推出 Claudeforce,作为 SaaS 为 AI 调用底座价值的论据。