老董的视界深处

· 国金证券 · 公司/行业基本面

国金证券 大模型赋能投研系列之三十二:升级后Deepseek V4.1 Flash投研能力有多强?

摘要公开阅读;PDF 仅限有效会员阅读与下载,所有会员权限相同。 邮件登录

摘要

国金证券金融工程组在DeepSeek V4.1 Flash发布后立即对其投研能力做系统实测。 V4.1 Flash于2026年9月10日发布,为新模型结构系列中尺寸最小的成员,原生支持多模态、100万Token上下文和最高384K Token输出;架构上采用输入端每Token约8B、输出端约16B的非对称激活,KV缓存压缩至每Token 890字节、显存占用降至上一代四分之一,但权重增至约510GB,本地部署门槛由两张卡升至一个8卡节点。 成本需分口径看:API用户的缓存命中、输入、输出价格较DeepSeek V4 Pro分别下降约86.4%、77.3%和69.7%,自部署用户总拥有成本反而上升。 七项公开测试相对上一代V4 Flash全部提升,其中代码与智能体类五项超过参数更大的V4 Pro(如Codeforces 3921对3850、DeepSWE v1.1 74.2对62.7),科学知识与推理两项仍低于Pro。 在估值建模、多因子回测、行业研究三类真实投研任务中,GPT-6 Astra三项均列第一,DeepSeek V4.1 Flash在估值与行业研究均排第二、回测排第三,估值与行业研究两项超过V4 Pro;Artificial Analysis综合得分40分居五款第三。 报告结论认为V4.1 Flash已能承担估值建模、量化回测、行业资料检索和知识库建设等长程投研任务,不足集中在回测交易约束以及交付物内部数字与来源的一致性,投研场景仍不能省略程序检查与分析师复核两道核查。

主要观点

  • DeepSeek于2026年9月10日发布V4.1 Flash,为新模型结构系列中尺寸最小的成员,原生支持多模态、100万Token上下文和最高384K Token输出;发布当天旧版V4 Flash与V4 Flash Vision Exp正式下线,旧模型名暂时路由至新模型。
  • 新架构采用Causal Encoder-Decoder设计(20层因果编码器衔接20层解码器,384个路由专家加1个共享专家、每token激活6个),输入端每Token仅激活约8B参数、输出端约16B,压低Agent长任务中占大头的输入侧算力开销;第二代压缩稀疏注意力将全局KV cache压缩至890 bytes/token,HBM占用降至上一代的1/4。
  • 能力提升集中于代码与智能体:七项公开测试相对V4 Flash全部提升,代码与智能体五项超过V4 Pro(Codeforces 3921对3850、DeepSWE v1.1 74.2对62.7、NL2Repo-Bench 65.4对54.2、ProgramBench 20.3对15.5、Terminal-Bench 2.1 90.6对87.9);GPQA Diamond 90.9与HLE 36.8(纯文本子集39.1)仍低于Pro的92.4与42.7。
  • 部署与成本需分两个口径:权重升至约510GB(FP8),实际部署下限约为一个8卡节点(如8×H200合计约1,128GB),自部署用户总拥有成本上升;对API用户,缓存命中、缓存未命中输入、输出价格较V4 Pro分别下降约86.4%、77.3%和69.7%(标准价由0.044/1.32/3.96降至0.006/0.3/1.2美元)。
  • 横向价格对比:V4.1 Flash输入0.3、输出1.2美元,显著低于Kimi K3(3/15美元)与GPT-6 Astra(10/50美元);缓存命中价每百万Token仅0.006美元、为GLM-5.3 Flash(0.03)的五分之一,错峰还可低至0.003美元——缓存命中率高的Agent长任务DeepSeek更省,以新输入和一次性生成为主的负载则GLM-5.3 Flash更便宜。
  • 第三方Artificial Analysis评测中,V4.1 Flash综合得分40分列五款第三,低于GPT-6 Astra(53分)与Kimi K3(44分),但高于V4 Pro(36分)与V4 Flash(35分),为DeepSeek系列最高;Terminal-Bench v4.0由12%/14%升至27%、GDPval-AA v2由48%/50%升至57%(五款最高),但在AA-Omniscience(8%)、GDP.pdf(13%)上明显落后。
  • 估值任务(以中际旭创为对象)排序为GPT-6 Astra、DeepSeek V4.1 Flash、DeepSeek V4 Flash、Kimi K3、DeepSeek V4 Pro;V4.1 Flash是DeepSeek所有模型中首个把销量与单价假设真正接入估值过程的版本,底稿可重算且报告与底稿一致,差距在于拆解仅到整体量价一层、未设经营情景。
  • 回测任务(基于沪深300历史实际成分股)排序为GPT-6 Astra、DeepSeek V4 Pro、DeepSeek V4.1 Flash、DeepSeek V4 Flash、Kimi K3;V4.1 Flash是五款中唯一以全收益指数为基准、并单设独立校验模块检验未来函数的模型,但交易成本、涨跌停与独立执行日三项约束缺失。
  • 行业研究任务(半导体设备产业链)排序为GPT-6 Astra、DeepSeek V4.1 Flash、DeepSeek V4 Pro、DeepSeek V4 Flash、Kimi K3;V4.1 Flash建立63个公司实体页、7个主题页、4个综合分析页和6个来源摘要页,双链完整无孤立页,知识沉淀较上一代(V4 Flash仅2个实体页)有数量级提升,缺口在实体页无来源反链、六维评分多数环节无法按权重复算。
  • 总体结论:DeepSeek V4.1 Flash已能承担估值建模、量化回测、行业资料检索和知识库建设等长程投研任务,在估值建模和行业研究两项上超过参数规模更大的V4 Pro,短板集中在回测的交易约束及交付物内部一致性;GPT-6 Astra三项均第一但调用成本明显更高。
  • 报告强调投研场景不能省略两道核查:程序检查公式、字段、时点和链接,分析师复核业务假设、交易约束、数据口径和来源质量;结果仅对应统一Prompt、max思考强度和本次只读宿主环境,不应外推为所有工具配置下的稳定表现。

论述逻辑

  • DeepSeek发布新架构、原生多模态的V4.1 Flash → 报告先用公开规格(总参数552B、激活8B/16B、最大输出384K)、API价格(较V4 Pro缓存命中降约86.4%/输入降约77.3%/输出降约69.7%)、七项公开基准与Artificial Analysis分数(40分、五款第三)刻画其能力画像:代码与智能体强、知识推理未超Pro、API便宜但本地部署门槛升至8卡节点 → 再设置估值建模(中际旭创)、多因子回测(沪深300历史成分股)、行业研究(半导体设备产业链)三类真实投研任务,用统一Prompt将V4.1 Flash与DeepSeek V4 Flash、V4 Pro、GPT-6 Astra、Kimi K3实测对比 → 从交付完整度、底稿可复算性、交易约束处理、知识库沉淀与来源追溯逐项评分排名 → 得出GPT-6 Astra三项均第一、V4.1 Flash估值第二/回测第三/行业研究第二、估值与行业研究超越V4 Pro的结论 → 最终判断V4.1 Flash可承担长程投研任务,短板在回测交易约束与交付物内部一致性,投研仍需程序核查加分析师复核两道关。

关键展望

  • 报告未给出市场走势预测或个股目标价;明确的时间锚点是模型与价格信息仅反映2026年9月13日可获得的公开资料,且提示模型API价格、限速、产品功能及Harness兼容性可能调整。
  • 评测结论的适用边界被限定为统一Prompt、max思考强度和本次只读宿主环境,任务结果不应外推为所有Harness或工具配置下的稳定表现。
  • 兼容性安排:旧模型名deepseek-v4-flash、deepseek-v4-flash-vision-exp将被暂时路由至DeepSeek V4.1 Flash。
  • 风险提示明确:公开基准不能完全代表金融投研真实场景;回测结果受样本、复权、调仓时点、停牌/涨跌停约束和交易成本口径影响,历史表现不代表未来收益;大模型输出具有随机性并可能产生事实、代码、链接或计算错误,重要研究结论需人工复核。

推荐标的

  • 本报告为金融工程专题评测,未给出任何个股评级、目标价或证券推荐;估值任务中出现的目标价与“买入”评级均为被测大模型的输出内容而非报告观点,风险提示亦声明文中相关结论不构成投资建议。
  • 报告覆盖/评测对象为五款大模型:DeepSeek V4.1 Flash(重点研究对象)与DeepSeek V4 Flash、DeepSeek V4 Pro、GPT-6 Astra、Kimi K3横向比较,规格与价格对比另纳入GLM-5.3 Flash作为主要对标对象。
  • 三项任务综合排名:GPT-6 Astra估值/回测/行业研究均第一;DeepSeek V4.1 Flash依次为第二、第三、第二;DeepSeek V4 Pro依次为第五、第二、第三;DeepSeek V4 Flash依次为第三、第四、第四;Kimi K3依次为第四、第五、第五。

关键图表

图1. DeepSeek 历代模型 KV Cache 单 Token 容量对比

**图1. DeepSeek 历代模型 KV Cache 单 Token 容量对比**

图2. 图表 10: DeepSeek V4.1 Flash 交付的投资分析报告

**图2. 图表 10: DeepSeek V4.1 Flash 交付的投资分析报告**

图3. 图表 19: DeepSeek V4 Pro 部分公式异常

**图3. 图表 19: DeepSeek V4 Pro 部分公式异常**

图4. 图表 28: 回测任务 Prompt 总要求

**图4. 图表 28: 回测任务 Prompt 总要求**

图5. 图表 38: DeepSeek V4 Pro 交付的研究报告

**图5. 图表 38: DeepSeek V4 Pro 交付的研究报告**

图6. 图表 47: 行业研究任务 Prompt 总要求

**图6. 图表 47: 行业研究任务 Prompt 总要求**

图7. 图表 56: DeepSeek V4 Pro 交付的行业深度报告

**图7. 图表 56: DeepSeek V4 Pro 交付的行业深度报告**

图8. 图表 65: 模型行业研究任务表现对比

**图8. 图表 65: 模型行业研究任务表现对比**

查找相关研报 →