AI 日报

4个板块
10条资讯
4篇论文
5个开源项目
覆盖过去 48 小时
语音简报
AI 日报 · 2026年9月10日
语音版 · 小宇宙
00:00
--:--
📰

每日精选

10 条核心资讯
今日焦点
Cognition 用半年近乎翻倍的估值证明编程智能体是目前最被资本市场认可的 AI 商业模式;DeepSeek 一边用 V4.1 Flash 降价冲击同行股价、一边被曝筹备科创板 IPO,把技术、价格、资本三张牌同时打出来;商务部正面回击美方蒸馏指控。今日十条的主线是"钱开始用脚投票"——AI 商业化进入分化阶段
融资

Cognition AI 完成 20 亿美元 E 轮融资,估值 480 亿美元,收入四个月接近翻倍

AI 编程公司 Cognition AI(产品为自主软件工程智能体 Devin)宣布完成 20 亿美元 E 轮融资,估值 480 亿美元,由新投资方 a16z 与 Accel 领投,老股东 Founders Fund、General Catalyst、Avenir 跟投。公司称 run-rate 收入自 5 月上一轮以来从 4.92 亿美元增至近 9 亿美元;估值较 5 月的 260 亿美元(当时融资 10 亿美元)近乎翻倍。编程智能体正在成为第一个被资本市场按"收入增速"定价的 Agent 品类。

模型

Claude Fable 5.1 / Mythos 5.1 发布:同一模型、两套护栏,价格直降 25%(本期补录)

Anthropic 发布 Claude Fable 5.1 与 Claude Mythos 5.1:两者为同一底层模型,Fable 5.1 全面开放,Mythos 5.1 仅通过可信访问计划提供,护栏面向网络安全与生命科学。典型负载价格较 Fable 5 低约 25%(缓存读降价),高 Agent 负载最高省约 45%;企业客户将获得 EFS 数据保障——数据存于客户自己控制的基础设施。基准方面:Terminal-Bench-Science 0.1 达 52.6%(Opus 5 为 29.0%,GPT-5.6 Sol 为 22.4%);Millennium 内部测试中,它定位到一个工程师数年未能解释的百万分之一概率崩溃。发布于 9 月 1 日,本期补录。

来源:Anthropic
政策

商务部回应美方"工业级蒸馏"公告:于事无凭、于法无据,必要时坚决反制

就 NSA/CISA/FBI 联合公告 AA26-251A 点名六家中国 AI 公司一事,商务部新闻发言人答记者问:指控于事无凭、于法无据;蒸馏是包括美企在内的全球模型企业通行做法,本质是中性技术手段,美企模型研发报告也披露大量蒸馏中国模型;美方将个别企业和资本利益与国家安全捆绑、为用户协议中的霸王条款背书。中方表示愿在两国元首同意的 AI 政府间对话框架下开展建设性讨论,但若美方以打击蒸馏为名实施遏压行动,必将坚决反制。这是昨日重点第 2 条的直接后续——蒸馏争议从企业合规问题正式升级为国家间规则博弈。

来源:央视网
热点

DeepSeek 被曝已委托中信证券筹备科创板 IPO,进入尽调阶段

据财联社等媒体报道,DeepSeek 已委托中信证券筹备科创板 IPO,目前进入尽职调查阶段,计划年内启动流程,但尚未签署正式辅导协议,公司未正式回应。若成行将成为"国产大模型第一股"。结合昨日官宣的 V4.1 Flash(官方称性能、费用、速度全面超越 V4 Pro)与今日同行股价承压,DeepSeek 正同时打技术、价格、资本三张牌。

来源:财联社(转载) · 未获公司确认
市场

V4.1 Flash 调价余波:智谱港股跌 7.88%,MiniMax 跌 6.73%

DeepSeek V4.1 Flash 调价消息持续发酵,智谱港股收跌 7.88%、MiniMax 跌 6.73%,月内累计回撤分别达 29.58% 与 14.27%。摩根士丹利认为 DeepSeek 降价引发"无序恶性竞争"的概率较低,但资本市场已开始为国产模型价格战重新定价——同一天 DeepSeek 被曝筹备 IPO,压力与机遇都在向头部集中。

算力

AMD 将 2030 年 AI 芯片市场预测上调至 3 万亿美元

AMD CFO 在活动中将 2030 年 AI 芯片市场规模预测上调至 3 万亿美元,消息公布后 AMD 股价上涨约 3%。芯片厂商持续上修长期需求曲线,与本周 Anthropic 800 亿美元算力协议、工信部 2030 算力规划相互印证:算力军备的时间尺度已经拉到五年以上。

来源:24/7 Wall St. · 官方材料原文未核
算力

ASML High-NA EUV 落地路线:台积电 2030 年起采用,三星 2028 年用于 DRAM

据行业媒体报道,ASML 正与台积电、三星、英特尔推进 High-NA EUV 光刻技术落地:台积电计划 2030 年起采用,三星计划 2028 年率先将其用于 DRAM 制程。AI 芯片对先进制程的胃口,正在把 High-NA 从"技术演示"推向"量产排期"。

来源:行业媒体 · ASML 官方原文未核
融资

Lightfield 完成 4700 万美元 A 轮:a16z 领投,5000+ 公司在用

AI 工作流平台 Lightfield 宣布完成 4700 万美元 A 轮融资,a16z 领投。官方博客称平台累计已有 5000 多家公司注册使用。办公场景的 AI 工作流工具仍在密集获得早期资本下注。

融资

Antioch 完成 3200 万美元 A 轮:把机器人测试搬进仿真

Greylock 领投。Antioch 致力于将机器人测试与仿真转化为软件化开发流程,相当于给物理 AI 做"持续集成"。继 Arm 发布机器人生态计划之后,物理 AI 赛道的配套工具链继续获得资本下注。

来源:SiliconANGLE
产品

Resect AI 脱离隐身:2500 万美元做 AI 幻觉检测与修正层(本期补录)

Resect AI 宣布脱离隐身状态并完成 2500 万美元融资(投资方未公开),目标是构建独立于模型厂商的 AI 幻觉检测与修正层。发布于 9 月 3 日,本期补录。当 Agent 开始替人发邮件、付账单,"幻觉"从体验问题变成资金安全问题——独立的纠错层正在成为新的创业方向。

一句话总结:编程智能体率先跑通商业模式,国产模型进入价格与资本的双线竞争,蒸馏争议升级为国家间规则博弈——AI 行业今天的关键词是"分化"。
🔍

行业洞见

深度分析
今日洞见 · AI 价值链的分层时刻

应用层吃肉、模型层内卷:480 亿美元估值与 7.88% 的单日跌幅

今日焦点
同一天的两组数字:Cognition AI 估值从 260 亿到 480 亿美元只用了四个月,run-rate 收入从 4.92 亿增至近 9 亿美元;智谱港股单日跌 7.88%、MiniMax 跌 6.73%,月内回撤近三成。一边是编程智能体的估值跃升,一边是通用模型厂商的股价承压——AI 价值链正在明确分层。

先看应用层为什么贵。Cognition 卖的不是"模型能力",而是"可交付的软件工程成果":规划、编写、测试、部署一条龙。当客户按结果而非按 token 付费,收入就能随 Agent 可靠性提升而复利式增长——四个月 run-rate 接近翻倍,资本市场自然愿意按增速定价。这也解释了为什么 Anthropic 新模型发布时特意强调"高 Agent 负载最高省 45%":前沿厂商在主动为 Agent 应用层的经济学让利

再看模型层为什么难。DeepSeek V4.1 Flash 官宣"性能、费用、速度全面超越 V4 Pro",本质是把旗舰能力打到白菜价:

  • 价格战常态化:Flash 反超 Pro 意味着"便宜更好"成为明牌,同质化的通用模型只能跟着降价;
  • 资本市场重定价:智谱、MiniMax 月内回撤 29.58%、14.27%,市场在为"模型层毛利率长期受损"预付代价;
  • 头部虹吸:同一天 DeepSeek 被曝筹备 IPO——用资本市场的钱打价格战,再用价格战换市场份额去上市,闭环正在成型。

把镜头拉远,这周其实是一体的:CISA 公告与商务部回应说明模型层的竞争已经不只在市场进行,还在规则层面进行;而 Cognition 的 480 亿美元说明,真正的利润层可能不在模型本身,而在能把模型变成"成果"的 Agent 应用。模型走向水电煤,应用走向利润层——今天两条股价曲线,就是这条分界线的实时投影。

一句话总结:当"卖模型"开始打价格战、"卖成果"开始按增速估值,AI 行业的第一轮价值链分层已经写进了 K 线图。
📄

论文速递

从 arXiv 筛选 · 9 月 9 日
今日概览
今天四篇论文共享一个母题:"谁来给 AI 系统做工程"。Φ-Bench 问 LLM 能不能工程化自己的基础设施;Strangers to Themselves 发现 LLM 其实并不了解自己;VLX-VR 给视频推理装上"边看边记"的 Agent 循环;Feyospace 用七个人的小团队证明前沿赛博模型不再是大厂专利。
01 Φ-Bench:LLM 能修好自己脚下的基础设施吗
基准评测 基础设施工程 AI for AI
Φ-Bench 把"LLM 基础设施工程"变成可评测的任务族,覆盖从 kernel 级函数补全端到端系统优化的完整工程栈,系统刻画前沿 LLM 在此类任务上的能力边界。当 AI 开始被用来改进 AI 自己运行的算力栈(AMD 与 OpenAI 也在做类似的事),"模型能不能当基础设施工程师"第一次有了标准答案的考卷。
  • 把散落的 infra 工程任务统一为分层基准,能力边界可横向比较
  • kernel 补全与系统级优化的分数差异,暴露"局部聪明、全局抓瞎"的模式
  • 为"AI 改进 AI 底座"的自动化闭环提供了第一份量化基线
原文:Φ-Bench: Can Large Language Models Engineer the Infrastructure That Powers Them? →
02 Strangers to Themselves:LLM 的自我报告基本不可信
评测方法论 自我认知 可靠性
论文用 9 项行为评估检验"问模型它自己"是否可靠:LLM 自我报告与实际行为的相关性仅 r=+0.04;即便把完整题目项都给模型预测,也只有 +0.24;而把同样的问题改成问"通用 AI 代理",效果反而更好(+0.28)。更糟的是,第一人称框架会引入系统性的美化偏差——模型描述的自己比实际表现更漂亮。
  • "问模型它自己"不能替代行为化评测,个性化与安全审查场景尤需警惕
  • 第一人称陈述存在系统性自我美化,问卷式能力自评全部失真
  • 对依赖模型自我报告做产品决策(推荐、风控、心理类应用)是直接警示
原文:Strangers to Themselves: What Language Models Say About Themselves Is Generic →
03 VLX-VR:会"边看边记"的视频推理模型
视频推理 Agent 循环 MINERVA SOTA
VLX-VR 把 Agent 的Think-Memory-Observation 循环引入视频推理:模型边看边把关键信息写入外部记忆,再按需回看。在 MINERVA 基准上达到 78.79%(SOTA),跨时长精度方差仅 2.97pp²,96.20% 的推理轨迹与参考一致。视频理解正从"一口气看完再回答"转向 Agent 式的主动观察。
  • 外部记忆 + 主动回看,绕开长视频"上下文装不下"的硬约束
  • 跨时长稳定性(方差 2.97pp²)是监控、具身场景落地的关键指标
  • 推理轨迹 96.20% 与参考一致,行为可审计性显著优于黑盒端到端
原文:VLX-VR: An Agentic-Aware Video Reasoning Model →
04 Feyospace-v1:七个人的"赛博水星计划"
网络安全 开放权重 小团队
一个 7 人独立团队训练出开放权重的赛博安全 Agent:构建 164,269 条轨迹的数据集,在 CyberGym 上将成绩提升 23.76%,feyospace-s1 达到 63.24% 验证成功率、CyberGym 排名第 10。在"前沿模型 = 大厂专利"的叙事里,这篇论文提供了一个反例:小团队 + 开放权重 + 垂直领域数据飞轮,同样能摸到专有系统的门槛。
  • 16 万条轨迹的领域数据集本身就是重要产出,可复用于后续研究
  • 安全 Agent 的能力主要来自轨迹积累,而非单纯的基座规模
  • 开源阵营逼近闭源专有系统的又一实证(与昨天 Deposon 的可审计路线互补)
原文:Feyospace-v1: How the Cyber Mercury Seven Trained Frontier Cyber Models →
也值得关注
05 FOM-UL 层选择性遗忘框架:用 forget-to-retain 显著性定位需遗忘的层,在 TOFU/KnowUnDo/MUSE 上超越 GA/NPO 等基线,8-bit/4-bit 量化下仍保持遗忘效果。链接
06 SocialRL 多轮强化学习 + 六维过程奖励设计,提升 LLM 社交智能,多个社交对话基准目标达成率平均 +9.2 个百分点。链接
07 WRP 无前向传播深度剪枝:仅从 checkpoint 权重估计层间冗余,无需校准数据,接近激活基方法的效果。链接
08 DDO 偏好后训练中的直接多样性优化:在 BabyAI/BabaIsAI/WebShop 上同时取得最高任务成功率与成功策略覆盖率。链接
今日观察
四篇连起来是一条主线:AI 系统的工程化正在下沉与分工——大厂负责基座,小团队也能用开放权重 + 领域数据训出前沿专用模型(Feyospace);人不再手工调基础设施,LLM 开始接手(Φ-Bench);"问模型自己"被证明不可靠,评测全面转向行为化(Strangers to Themselves);视频理解也装上了 Agent 的记忆循环(VLX-VR)。能力扩散 + 工程纪律,是本周论文栏的两个关键词。
一句话总结:当七个人能训出前沿赛博模型、LLM 开始修自己的基础设施,"前沿 AI"正在从大厂的专利变成一门工程学科。

开源解读

GitHub 热门
今日焦点
本周开源榜的关键词是 Agent Skills 生态成型:Anthropic 官方 Skills 仓库重回周榜,技能生成工具(archify)、领域技能库(scientific-agent-skills)、本地语音栈(VoiceStudio)、教育向训练套件(minimind)同时起量。从"怎么写技能"到"技能长什么样"再到"技能覆盖哪些领域",整条链路都在热——与昨天 NVIDIA 的技能安全扫描器 SkillSpector 恰好拼成完整拼图。
1
tt-a1i / archify ★ 56.4k · 本周 +12.5k JavaScript

Agent 技能:一句话生成架构图、工作流图、序列图的自包含 HTML 动效页面,本周 GitHub Trending 周榜最大涨幅之一。它踩中的是 Agent 生态的真实痛点——让 Agent 输出"人一眼能看懂"的系统结构图,而不是一坨文字。

2
debpalash / VoiceStudio ★ 22.0k · 本周 +7.5k Python

本地 ElevenLabs 替代品:语音克隆、语音设计、配音、转录一站式,支持 646 种语言。本周 +7.5k 星的背后,是语音 AI 从 API 订阅走向本地自托管的需求拐点——与本期日报的语音管线(本地 TTS 生成)是同一股潮流。

3
anthropics / skills ★ 175.5k · 本周 +2.3k Python

Anthropic 官方的 Agent Skills 仓库:Claude 技能的标准实现与示例。总星已超 17.5 万、本周仍增 2.3k,官方标准仓库的持续吸星说明"技能"正从概念变成 Agent 开发的默认单元——本榜其余几个项目都长在它定义的生态位上。

4
K-Dense-AI / scientific-agent-skills ★ 44.2k · 本周 +2.1k Python

科学领域 Agent Skills 库:165+ 经验证的技能与 100+ 科学数据库接入。通用技能仓库解决"会不会写",领域技能库解决"懂不懂行"——科研场景正在成为 Agent 技能落地的第一条纵深战线。

5
jingyaogong / minimind ★ 60.4k · 本周 +2.6k Python

两小时从零训练一个 64M 参数 LLM 的极简教学项目,中文社区长青项目本周重回周榜。在教育向项目持续吸星的同一周,Feyospace 论文证明 7 人团队可训前沿赛博模型——"训练大模型"的知识门槛正在以肉眼可见的速度下降。

一句话总结:当官方仓库、生成工具、领域库同时上榜,Agent Skills 已经从"新概念"变成"有完整配套产业的标准件"。