计算机行业研究:GPT 6 ASTRA发布,不只是Coding
摘要公开阅读;PDF 仅限有效会员阅读与下载,所有会员权限相同。 邮件登录
摘要
国金证券计算机团队解读 OpenAI 于 2026 年 9 月 4 日正式发布的 GPT-6 Astra,认为其意义不止于编码能力提升。 第三方 ARC Prize 评测中,切换 Provider Adapter 框架后 Astra(high)得分高达 99.9%,96.0% 的关卡操作次数少于人类参与者中位数,Harvey、Cognition 等产业用户实测亦确认模型已能对商业产品形成实际赋能。 报告指出资本市场核心担忧在于大模型商业化收入过度依赖 Coding 场景、非编码专业场景端到端交付能力不足,而 Astra 证明非编码专业任务能力迎来实质性跃迁,办公、法务、科研、硬件设计等非代码场景商业化进程有望加速。 报告同时提示法律、科研等高风险业务模型输出仍需专业人员审核,并列示大模型&云、海外算力、国内算力、AI 应用四条主线相关标的;风险提示包括行业竞争加剧、技术研发进度不及预期、特定行业下游资本开支周期性波动。
主要观点
- GPT-6 Astra 于 2026 年 9 月 4 日正式发布,采取分阶段灰度开放策略:先定向向部分机构客户开放,后续数日逐步覆盖 ChatGPT Plus、Pro、Business、Enterprise 全量付费用户,支持 OpenAI API、Microsoft Azure、AWS Bedrock 三大调用渠道;企业工作空间默认关闭 Astra 访问权限,需管理员手动开启,体现高能力模型企业部署的安全管控思路。
- 计算机自主操作能力显著增强:模型可独立完成表单填写、CRM 更新、软件故障排查等真实电脑实操任务,OSWorld 2.0 延迟模拟测试中 Astra 得分 72.6%、单任务平均耗时约 40 分钟,前代 GPT-5.6 Sol 得分 65.7%、耗时 75 分钟,单任务完成时间直接降低约 47%,AI 从输出文本代码转向直接操作软件跑完完整业务链路。
- 专业工作流能力强化:Astra 将电脑操作能力与专业环境训练结合,可遵循已有模板、匹配写作与视觉风格,官方示例包括在 KiCad 中完成印刷电路板布局、基于 OpenAI 演示文稿模板制作幻灯片、在 Blender 建模住宅并转化为 Unreal Engine 5 可漫游场景,输出文档、电子表格与演示文稿等专业成品。
- 人机协作能力提升:Astra 能利用上下文补全常规信息缺口、在答案可能影响结果时提出针对性问题,可将新增要求纳入原任务、减少中途调整导致的目标约束丢失,Codex 中可一边等待用户回复一边继续不依赖该回复的工作,重要决定则等待用户输入。
- 编程能力持续迭代:Terminal-Bench 4.0 评测 Astra 得分 57.9%、GPT-5.6 Sol 仅 37.3%,DeepSWE v1.1 得分 74.1%;OpenAI 为 Codex 配套跨上下文窗口保存笔记、支持检索历史窗口全部信息的长任务记忆实验功能,官方计划数周后设为默认能力,缓解超长任务信息压缩失真痛点。
- 数学与科研能力大幅走高:FrontierMath Tier4(v2)评测 Astra 得分 97.6%(前代 83.0%),GPQA Diamond 得分 96.0%(前代 94.6%);官方演示显示模型可直接调用专业科研软件完成测序质量校验、遗传变异可视化,真正介入科研实操环节。
- 网络安全能力达到 OpenAI Preparedness Framework 的 Critical 关键能力阈值:关闭生产防护的测试环境中 ExploitBench 拿到 100% 满分(前代 78.5%);面向普通用户的正式版本仅支持安全代码审查、漏洞修补等防御性工作,拒绝生成漏洞利用 POC 等高风险任务,实行能力分级管控。
- ARC Prize 第三方评测表现亮眼但需理性看待:ARC-AGI-3 半私有测试集标准框架下 Astra(max)得分 62.7%,切换支持跨请求推理状态保存、长对话压缩的 Provider Adapter 框架后 Astra(high)得分高达 99.9%,96.0% 的关卡操作次数少于人类参与者中位数、平均每关操作次数降低 51.7%;ARC Prize 特别提示接近满分不等同于实现 AGI,模型实际效果由模型本体与运行调度框架共同决定。
- 产业专业用户实测佐证模型实力:法律服务商 Harvey 应用研究负责人 Niko Grupen 反馈 Astra 可区分原始文件与既定业务记录、识别缺少论据支撑的假设并转化为可落地的法律起草立场;Cognition 研究高级副总裁 Silas Alberti 表示电脑操作、文本写作、代码库理解能力升级直接优化 Devin 产品内部测试效果,说明模型已能对下游产品形成实际赋能。
- 市场核心担忧在于商业化高度依赖编码赛道:现阶段大模型商业化收入很大一部分来自代码生成、代码辅助类 Coding 场景,办公、法律、科研、硬件设计等非编码场景大多仅能完成信息摘抄、初稿辅助,端到端闭环能力不足,若 B 端付费长期集中在软件开发赛道,大模型行业长期空间与厂商长期价值判断将受压制。
- GPT-6 Astra 发布的核心信号是非编码专业任务端到端交付能力实质性跃迁:自主操作电脑完成表单填写、CRM 维护、日历管理,输出符合企业模板的 PPT、表格、正式文档,完成 PCB 硬件设计、3D 建模引擎联动、法律材料梳理、科研数据分析等非代码任务,推动模型从问答工具转变为任务执行主体;在 2026 年头部大模型厂商 ARR 持续快速增长的背景下,ASTRA 有望消除部分商业化担忧。
- 能力边界需客观看待:现阶段优先看好结果易核验、出错易修正的普通办公自动化场景,法律文书、科研结论、网络安全等高风险业务模型输出必须经专业人员审核,不能直接采信,官方演示案例不能直接等同于全行业规模化生产力提升。
论述逻辑
- 事件起点:OpenAI 于 2026 年 9 月 4 日发布 GPT-6 Astra,分阶段灰度开放并覆盖三大调用渠道,企业侧默认关闭权限体现安全管控。
- 能力验证:OSWorld 2.0、Terminal-Bench、FrontierMath、ExploitBench 等基准全面超越前代 GPT-5.6 Sol,证明计算机操作、编程、数理科研、网络安全多维升级。
- 第三方与产业佐证:ARC Prize 评测高分(Provider Adapter 框架下 99.9%)与 Harvey、Cognition 实测反馈确认模型能力可对商业产品形成实际赋能,但跑分不等同于 AGI 或真实业务落地。
- 映射市场担忧:资本市场担心大模型商业化收入过度依赖 Coding,非编码专业场景端到端交付能力不足、落地进度缓慢,压制行业长期天花板。
- 得出结论:Astra 证明非编码专业场景能力迎来拐点,商业化叙事有望跳出编码单一赛道,国内厂商除编码外还需布局通用办公、多行业专业工作流、计算机操作智能体方向。
关键展望
- 后续数日 Astra 将逐步覆盖 ChatGPT Plus、Pro、Business、Enterprise 全量付费用户,Pro、Business、Enterprise 企业用户可额外获取更高规格的 GPT-6 Astra Pro 版本。
- 官方计划数周后将 Codex 长任务上下文记忆实验功能设置为 Astra 默认能力,缓解超长任务下上下文丢失、信息压缩失真的行业痛点。
- 办公、法务、科研、硬件设计等非代码场景商业化进程有望加速,办公、专业服务赛道商业化落地节奏有望加速,拓宽大模型整体商业化空间。
- 未来面向 B 端岗位的端到端任务交付能力或将成为大模型商业化竞争的关键分水岭,国内厂商除打磨编码能力外,需在通用办公、多行业专业工作流、计算机操作智能体方向持续投入。
- 风险提示:行业竞争加剧(影响利润率)、技术研发进度不及预期(影响大模型厂商商业化)、特定行业下游资本开支周期性波动(云厂商、运营商等客户对 AI 服务器与算力基础设施投资力度波动)。
推荐标的
- 大模型&云相关标的:智谱、MiniMax、阿里巴巴、腾讯控股、金山云、百度集团、优刻得、首都在线、网宿科技、云赛智联、青云科技等(报告列示相关标的,未给出个股评级)。
- 海外算力相关标的:东山精密、工业富联、胜宏科技、江海股份、中际旭创、中钨高新、蓝思科技、东阳光、火炬电子、三环集团、欧科亿、天孚通信、鼎泰高科、新易盛、领益智造、兆易创新、鹏鼎控股、唯科科技、天岳先进、大普微、源杰科技、麦格米特、景旺电子、英维克、京东方等,以及英特尔、SK 海力士、Lumentum、闪迪、铠侠、美光(报告未给出个股评级)。
- 国内算力相关标的:寒武纪、海光信息、长鑫科技、东阳光、利通电子、中芯国际、华虹半导体、华达科技、摩尔线程、天数智芯、沐曦股份、壁仞科技、协创数据、禾盛新材、华丰科技、杰华特、京基智农、中科曙光、浪潮信息、利扬芯片、胜蓝股份、华勤技术、国科微、中国长城、晶科科技、罗曼股份、盈峰环境、芯原股份、亿田智能、豫能控股、星环科技、鸿日达、盛视科技、神州数码、润泽科技、大位科技、润建股份、奥飞数据、瑞晟智能、科华数据、潍柴重机、欧陆通、杰创智能、奥尼电子(报告未给出个股评级)。
- AI 应用相关标的:达梦数据、深信服、卓易信息、星环科技、广立微、绿盟科技、网宿科技、海天瑞声、合合信息、德才股份、美年健康、真爱美家、中控技术、迈富时、金蝶国际、康众医疗、用友网络、聚水潭、阜博集团、范式智能、汇量科技、金山办公、奔图科技、中国软件(报告未给出个股评级)。
关键图表
图1. 行业研究
