AI 日报

4个板块
15条资讯
4篇论文
7个开源项目
覆盖过去 48 小时
语音简报
AI 日报 · 2026年9月18日
语音版 · 小宇宙
00:00
--:--
📰

每日精选

15 条核心资讯
今日焦点
配速之辩第七天,两条线同时推进:一条往上——英王查尔斯在邓弗里斯庄园当面要求 OpenAI、Anthropic、DeepMind、英伟达等 AI 领袖确保 AI「处于人类控制之下」;一条往里——Anthropic 首次公开前沿实验室内部的研发节奏数据:Claude 已主导 26% 的内部 AI 研发工作,约 3 万个智能体同时在跑,AI 研发算力约 6% 用于安全。与此同时,供给端没有减速:OpenAI 把最强模型按行业定制卖进律所、在 ChatGPT 里测试「赞助智能体」广告,华为把芯片路线图排到 2029。「要不要慢」第一次有了刻度,但刻度上读出来的仍是「在加速」。本期另含 09-17 晚间补录 7 条的合并发布。

本期已于 09-18 上午更新:按信源清单重新采集,新增 4 条官方来源条目,更正亚马逊一条的来源与表述,以及会场地名。
政策

英王查尔斯三世在邓弗里斯庄园召集 AI 峰会,当面要求 OpenAI、Anthropic、DeepMind、英伟达高管确保 AI「处于人类控制之下、服务于人与地球」;黄仁勋回应「不够安全就压回去继续工程」

AP 09-17 全文已核。国王开幕致辞原话:「AI 的发展——其实质与其速度——既引人入胜,又同样令人深感忧虑」;此类技术落入错误之手、被以潜在灾难性方式使用的「存在性危险」应被紧急考虑;「那么,我们难道不需要在一切为时已晚之前,拥有足够的控制手段吗?」他要求与会者思考指导 AI 发展的「基本原则」、如何「以安全为核心」驾驭 AI 的益处、如何「建立国际合作与共识」,并称与会者的任务「不仅是推进技术,而是确保它坚定地服务于人类、共同体与自然世界」。与会者含英伟达 CEO 黄仁勋、Google DeepMind 主席 Hassabis、OpenAI CFO Sarah Friar、英国 AI 大臣 Kanishka Narayan;白金汉宫声明称 Anthropic 代表预计出席。会场是国王基金会总部、苏格兰艾尔郡的邓弗里斯庄园。黄仁勋在国王之后发言:「当产品不够安全时,我们应该把它压回去,继续工程。我们一直这么做,也应该继续这么做」——AP 注明他批评过放缓呼吁,主张由各公司自行确保安全、发布前充分测试。另据 CNBC 报道(原文对采集环境拒绝访问,多家媒体一致引述),黄仁勋在峰会间隙对媒体称英伟达明年卖出的芯片将是今年的两倍,未说明统计口径;英伟达 09-16 官方博客称 Vera Rubin NVL72 首次参加 MLPerf 推理 v6.1 即取得领先成绩(厂商自报)。为什么值得看:配速之辩用七天从一封辞职信走到国家元首的会议桌,AP 把这条与 Coxon 辞职、Amodei 檄文、OpenAI 六份失配报告连成一条叙事线;但同一位掌门在同一天既谈「不安全就压回去」、又谈「明年翻倍」——控制是讲给台上听的,供给曲线仍在往右走。

来源:AP(已核全文) · 翻倍说法:CNBC(原文未能打开,多源一致)· 发布于 09-17
安全

Anthropic 首次公开前沿实验室内部的研发节奏数据:Claude 已「主导」26% 的内部 AI 研发工作,约 3 万个智能体同时在跑,AI 研发算力中约 6% 用于安全;并提议把这三项指标做成行业可核验的公开标准

Anthropic 官方 09-17 全文已核。三项测量:① AI 做了多少 AI 研发——采用 Epoch AI 的自动化等级量表(AL0 无 AI 参与至 AL5 完全自主),截至 2026 年 8 月,Claude 在任何被测子集上都没有完全自主运行,但「主导」(AL4:从高层指令端到端完成大部分任务,人类监督)了 26% 的内部 AI 研发工作,「协作」及以上的占比超过 90%;② 对智能体的监督——最常用的内部平台上任一时刻约有 3 万个智能体在做研究与工程工作,由实时拦截的在线监控和事后审阅的离线监控两层约束,按覆盖率、审阅延迟、升级率三个维度报告;③ 算力分配——7 月 13 日至 20 日一周的快照里,AI 研发算力约 6% 用于安全工作,「AI 驱动的 AI 研发」算力里这一比例约 12%,官方称这是刻意保守的估计,且不含安全分类器所用的另一块相当规模的算力。Anthropic 称,如果行业就 Amodei 呼吁的协同配速达成协调,这些数字预计会变化;它计划让多家独立第三方评估方嵌入公司,获得与内部风险评估团队相当的访问权,核验安全实践、报告事件并监测这类指标。为什么值得看:一周以来「要不要慢」一直是态度之争,这是第一次有前沿实验室把「现在有多快」拆成可追踪的数字——多大比例的研发已由 AI 主导、多少智能体在无人实时注视下工作、安全拿到多少算力。它和前一天 OpenAI 公开六份失配报告(09-17 期)是同一个动作:头部实验室开始把内部数据摊开,给 FRONTIER 法案的嵌入式评估和外部监督提供可以引用的刻度。也要看清局限:这是自测自报,用自家模型给自家打分,官方自己也承认缺少统一方法、需要第三方核验。

来源:Anthropic 官方(已核全文) · 发布于 09-17
模型

OpenAI 发布 Astra for Law:最强模型 GPT-6 Astra 首次按行业深度定制进入法律专业——法律检索覆盖 99.9%+ 美国已发布先例判例法,基准正确率 54.0% vs 纯网页搜索 38.7%

OpenAI 官方博客 09-17 全文已核。法律检索索引覆盖 2.3 亿+ URL(经 Free Law Project/CourtListener 合作);Vals AI 法律研究基准 200 题整体正确率 54.0% vs 同模型纯网页搜索的 38.7%(相对提升 40%),官方对比中 Claude Fable 5.1 在诉讼示例里返回了一个已被上诉推翻的判例;案例法问题上找到 24% 更多引用案例、同推理力度下从正确法院意见书检索到最多 54% 更多相关段落。渠道:先经 Trusted Access 在 ChatGPT 与 Codex 内向选定律所开放(API 名 gpt-6-astra-law),Harvey 与 Legora 将基于其构建;治理:符合条件律所享 API 零数据保留、ChatGPT Enterprise 默认排除人工审查,并与 Latham & Watkins 合作设计信息隔离墙;生态:26 个法律插件(iManage/Intapp/Thomson Reuters HighQ 等),Sullivan & Cromwell 等三家定制构建。为什么值得看:昨天还在发布失配报告框架谈「披露先行」,今天就把最强模型按行业定制卖进律所——安全叙事与商业化叙事并行不悖;前沿能力进入专业服务不是以通用助手、而是带着零数据保留、信息隔离墙、行业检索基建整套「信任包装」进来——模型能力与行业信任基建正在打包定价。

来源:OpenAI 官方博客(已核全文) · 发布于 09-17
产品

Anthropic 将 Claude Cowork 与 chat 合并为单一 Claude,推出 Docs 与 Slides 公测:「不再让你做选择」——任务该放哪里,由 Claude 自己判断

Anthropic 官方博客 09-16 全文已核(首次发现于 09-17 晚间,按用户指示并入本期)。官方解释合并理由:用户反馈最沮丧的是「决定任务该放哪里」,且两个入口之间上下文不通——「所以我们不再让你做选择」;Cowork 的聊天、项目、artifacts、连接器与技能全部保留;数周内向 Pro/Max 推送、Team/Free 随后,Enterprise 由管理员控制开启。文档与幻灯片可与 Claude 协作编辑、下载为 PowerPoint/PDF。为什么值得看:与 OpenAI 同周的 Astra for Law 构成两条路线——OpenAI 纵深行业定制,Anthropic 收敛通用入口;而中间层两边都在繁荣:knowledge-work-plugins 插件库 09-17 上榜 Trending、OpenAI 今日发 26 个法律插件——入口层收敛 + 能力层下沉,中间件生态成为两家的共同押注。

来源:Anthropic 官方博客(已核全文) · 发布于 09-16 · 首次发现于 09-17 晚间
基建

华为发布 Atlas 960 SuperPoD 并公布 Ascend 970/980 路线图(计划 2028/2029)——Trump-Xi 华盛顿会晤预期 09-24,会前不到两周中国把算力路线图排到 2029

AP 09-17 全文已核。Atlas 960 是不久前 Atlas 950 的更快后继者(AP 同文另称 950 于去年底推出),训练与推理双改进;AP 报道 Trump 同期淡化 AI 领袖们的放缓呼声,坚称美国必须保持对华领先——「谁在 AI 赢,谁就赢」;The Asia Group 合伙人 George Chen 对 AP 表示,发布时机「在习近平主席访问华盛顿前不到两周——凸显北京在技术与创新上的信心与雄心」。为什么值得看:配速之辩的美国内部在吵「要不要慢」,中国用排到 2029 年的路线图回答「继续快」;AP 同日分析点破结构——所有人都在说协调,但中美各自把对方视为问题本身;09-24 会晤成为配速之辩从行业辩论升格为地缘议程后的第一个观察节点。

来源:AP(已核全文) · 发布于 09-17
热点

亚马逊就配速之辩表态:模型应在严格测试证明安全后再发布,但不支持放缓开发——「我们不认为这是进步与安全之间的二选一」

路透社 09-17 报道(经 The Star 转载全文已核)。亚马逊发言人原话:「我们不认为这是进步与安全之间的二选一。模型应该在准备好、可以安全使用时发布,这来自严格的测试和强有力的防护」;「如果不能集体做到这一点,就会有风险。我们相信,作为一个行业,与政府合作,我们会找到正确的保护措施」。路透的归类是:Amodei 呼吁放缓之后,OpenAI、xAI、DeepMind 和微软的负责人支持「更审慎的做法」,英伟达和 Meta 则主张由各公司自行评估风险。更正说明:本期早版引用的 coindesk.cc 是仿冒 CoinDesk 的域名,本版改引路透原始报道;早版「亚马逊是第一个明确不站队降速的模型厂商」「光谱正式裂成两派」的说法,路透原文中没有——Meta 在 09-17 期已表态反对协同放缓。

政策

白宫 AI 高管会悬念持续:会拟安排在下周习近平国事访问「间隙」尚未敲定,AP 确认 Trump-Xi 华盛顿会晤预期 09-24——若成行,「配速之辩的白宫终章」将嵌进大国峰会议程

CNN 09-16 报道会拟安排在国事访问「间隙」、尚未敲定(09-17 期补录,已核);AP 今日报道确认 Trump-Xi 华盛顿会晤预期 09-24。此前 Trump 定性「AI 风险是骗局」(09-15 期)、白宫拟召集 OpenAI/Anthropic/Google 等高管讨论配速之辩——若会议在访问间隙成行,行业辩论将第一次进入 Oval Office 议程,并与中美 AI 竞合议题同场。

来源:AP(已核) · 发布于 09-16/17
政策

众议员 Lawler 与 Gottheimer 提出两党《Stop Rogue AI Act》:要求 NIST 制定发现、验证、控制 AI 智能体的国家标准——智能体身份「不是厂商说了算」

议员官网新闻稿全文已核,法案 PDF 随稿公开(09-15 发布、今日晚发现照收,保留发布时间)。四项能力要求:持续可读的智能体清单、可验证的身份与来源(Gottheimer:「不是厂商说了算」)、实时监控(提示注入/数据窃取/越权行为)、随时允许/拒绝/撤销智能体访问;联邦承包商与机构须将防护纳入采购流程,NIST 与 CISA 把标准并入联邦网安指引。为什么值得看:与 Kennedy 断路开关被一票挡下(09-17 期)对照,智能体层的立法抓手选的是「标准 + 采购」而非「开关」——用联邦采购权当杠杆,绕开了配速之争最僵的部分。

来源:Lawler 官网新闻稿(已核全文) · 发布于 09-15 · 今日发现
产品

OpenAI 在 ChatGPT 里测试「赞助智能体」广告:用户点广告后可与商家的智能体对话;Ads Manager 接入 ChatGPT,HubSpot 与 Shopify 成为首批 CRM 与电商伙伴

OpenAI 官方 09-16 全文已核。赞助智能体(Sponsored Agents)目前在美国与部分广告主测试:用户看到相关广告后,可以自行选择开启一段明确标注的、与商家赞助智能体的对话,这段对话与 ChatGPT 的独立回答、以及用户原本的对话相互分开。广告主可在 ChatGPT 里用自然语言通过 Ads Manager 插件创建、修改和分析投放;Ads Manager 新增 AI 生成文案与配图建议,以及可选的按对话语境改写、自动翻译广告文案。HubSpot 客户即日起可在 HubSpot 内投放和追踪 ChatGPT 广告;美国 Shopify 商家可通过新 App 投放,9 月 23 日起扩展到已开放 ChatGPT 广告的其他市场。为什么值得看:对照 09-16 期 1.2 万亿美元估值洽谈——广告正从「在回答旁边放一条」走向「让商家的智能体进入对话」,这是大模型商业化里离用户注意力最近的一步,也是「保护信任」这句承诺最容易被检验的地方。

来源:OpenAI 官方(已核全文) · 发布于 09-16
基建

Emerald AI、Google、英伟达成立 AI 能源管理联盟:推动数据中心按电网状况动态调整用电,把「刚性负荷」变成可调度资源

英伟达官方博客 09-16 已核。联盟(AI Energy Management Alliance)的目标,是让数据中心在电网紧张时通过迁移算力负载、储能放电、配套发电等方式调整从电网取的电,以换取更快、更大规模的并网,同时减轻对电网和社区的压力;官方称电力已成为美国 AI 基础设施扩张的决定性约束,而传统并网流程是为用电平稳的设施设计的。为什么值得看:放在众院 417:3 通过电费保护法案(09-17 期)之后读——立法要求数据中心为电网增量成本买单,行业这边的回应是把自己变成「可调节的大用户」来换更快并网;「谁买单」和「怎么接入」正在同时被重新定价。

来源:英伟达官方(已核全文) · 发布于 09-16
安全

Anthropic 推出生命科学验证计划:通过验证的生命科学团队可使用对生物相关工作放宽了防护的 Mythos、Opus、Sonnet 模型

Anthropic 官方 09-17 已核。早期访问阶段已接入数十家机构,现向更广的生命科学界开放申请,先以测试版面向团队和机构。为什么值得看:安全防护不再是一刀切——身份验证换取更宽的能力边界,这是分级访问第一次落在生物这个最敏感的领域;和同周的配速之辩同构:问题不只是开不开,而是给谁开、怎么核。

来源:Anthropic 官方(已核全文) · 发布于 09-17
基建

Intel CEO 陈立武:AI 智能体规模化推动 CPU 需求远超供给、目前仅能满足前沿客户约 50% 的需求;18A 已量产、14A 计划 2027 年一季度投产

TradingKey/TrendForce/新浪财经多源转述一致(原文未开)。多家大型科技公司 CEO 直接联系要求增加出货。为什么值得看:GPU 抢购潮之后,CPU 成为第二个出现可见供需缺口的品类——智能体基础设施的瓶颈正在从「算力单极」扩散到「通用计算」。

来源:TradingKey(转述级,三源一致) · 发布于 09-17
基建

Apple 据报开发 AI 推理服务器:可能搭载 2 或 4 枚 M8 Ultra 芯片,为 2011 年停售 Xserve 后首次重返企业服务器市场,产品最早 2029 年

The Information 经 9to5Mac 转述(两级转述、一手未开)。目标客户含 AI 开发者、企业与政府;报道称讨论过 NVIDIA NVLink Fusion 互连。为什么值得看:继自研推理栈之后的下一步——若成行,「端侧自研 + 云侧自研」闭环将补上最后一块,而 2029 年的时间表意味着 Apple 判断推理需求至少还要涨一个大周期。

来源:9to5Mac(转述 The Information,原文未开)· 发布于 09-16
产品

豆包座舱助手上车:与上汽合作,首款车型荣威家越 07 于 9 月 21 日开启预售、上汽奥迪车型年内亮相——CPP AI 原生架构打通整车控制/导航/辅助驾驶/用户生态

界面新闻经南方新闻网/36kr/汽车之家四源一致(摘要级;首次发现于 09-17 晚间,本期并入)。豆包 APP 可远程控车、查询车况、把对话中的行程推送到车机。为什么值得看:努比亚「智能体手机」(09-17 期)之后,智能体进座舱——字节把豆包从手机助手延伸为车机入口,与上汽的深度绑定给了它第一个规模化整车载体。

来源:界面新闻等四源一致(摘要级) · 发布于 09-17 · 首次发现于 09-17 晚间
政策

电费法案 S.5028 参院轨道确认:已送能源与自然资源委员会、至今无听证安排;众院表决后随即休会七周——大概率以「众议院表态」形式进入竞选期

govinfo 法案记录 + 多源(摘要级;首次发现于 09-17 晚间,本期并入)。众院版 H.R. 9340 以 417:3 通过(09-17 期)后,参院对应法案仍停在委员会,距 11 月 3 日选举休会约三周。为什么值得看:417:3 的压倒性票型与参院零听证的对照,说明「电费谁买单」在众院是共识、在参院是日程问题——配速之辩里走得最快的立法,也要等选举季之后才有下文。

来源:govinfo 法案记录 + 多源(摘要级) · 发布于 09-17 · 首次发现于 09-17 晚间
🔍

行业洞见

深度分析
今日洞见 · 配速之辩第七天

升格、量化、加速:辩论升到国家元首层,节奏第一次有了刻度,而供给端没有减速

今日焦点
48 小时内的三组镜头:邓弗里斯庄园的国王峰会把「控制」说到国家元首层级;Anthropic 把「有多快」拆成三个可追踪的数字;华为路线图排到 2029、OpenAI 行业定制与广告智能体同步开卖——「要不要慢」的辩论,第一次对上了「现在多快」的刻度。

先看升格。国王没有点名任何公司或国家,但「在一切为时已晚之前需要足够的控制手段」与 Amodei 的放缓呼吁指向同一方向——AP 把这条与 Coxon 辞职、Amodei 檄文、OpenAI 六份失配报告连成一条叙事线。09-24 的 Trump-Xi 会晤是下一个观察节点:白宫 AI 高管会若在国事访问「间隙」成行,这场辩论将同时出现在白宫与大国峰会的议程上。

再看量化。一周以来的争论大多是态度——Amodei 要刹车,Altman 说放缓不是停止,黄仁勋说市场自会解决,亚马逊说测试比降速重要。Anthropic 这次给的是刻度:26% 的内部研发由 Claude 主导、九成以上有 AI 协作,约 3 万个智能体同时在跑,安全拿到约 6% 的研发算力。这些数字本身不回答「该不该慢」,但让「慢了多少」第一次可以被检验——Anthropic 自己说,如果协同配速真的发生,这些数字会变。前提是第三方能核验;在那之前,它们仍是自测自报。

最后看加速。黄仁勋预告明年芯片翻倍(据 CNBC)、华为路线图排到 2029、OpenAI 前一天谈披露、今天卖行业定制还在 ChatGPT 里测广告智能体——供给端的每一条新闻都在加码。另一面,亚马逊和英伟达、Google 给出的答案都不是「慢」,而是「测试」与「并网」:用阈值换发布,用可调度的用电换更快接入。

  • 辩论升格:英王峰会 + 09-24 Trump-Xi 会晤——配速之辩从行业辩论进入地缘议程;
  • 节奏量化:Anthropic 公开研发自动化、智能体监督、安全算力三项指标——「多快」开始有数;
  • 供给不减:芯片翻倍预告、2029 路线图、行业定制与广告智能体——商业化与安全叙事并行。

接下来盯三件事:09-24 前后白宫 AI 高管会是否成行;OpenAI、Google 等是否跟进公布同类指标;FRONTIER 法案的嵌入式评估条款会不会把「第三方核验这些数字」写成义务。

一句话总结:辩论的层级一路向上,节奏第一次有了刻度——但刻度上读出来的,仍是「在加速」。
📄

论文速递

从 arXiv 筛选 · 9 月 17 日批次
今日概览
cs.LG 已更新至 09-17 批次(09-18 批次截至采集时尚未公布)。今天四篇在动三个「默认前提」:缩放指数不是给定的物理、涌现时点可以预报、多智能体的「刹车」有原理性天花板——外加一篇把测试时强化学习压到十万分之一参数。其中两篇为 09-17 晚间补录并入。
01 缩放指数是架构可调的:7.4B 模型增长架构以约 20× 更少计算匹配 GPT-3 13B——How Model Growth, Recursion, and Boundary Operators Influence Scaling Exponents
缩放定律 架构 循环深度
架构干预可以修改预训练缩放指数:循环(递归深度)提供「模型增长」机制,训练中增加循环次数;普通 transformer 加 boundary operator(归一化并注入更早 block)也能提升指数(幅度较小);数据受限多轮训练下,随规模增加循环数是计算最优的。为什么值得看:缩放定律通常被当作「给定的物理」——算力买多少、loss 降多少;这篇证明指数本身是架构可调的,「更深的可用深度」能在同一预算下买到更多智能,对数据受限时代的训练策略是直接弹药。44 页、代码开源。
  • 7.4B 模型增长架构以约 20× 更少计算在 CORE 上匹配 GPT-3 13B,效率增益随规模增大
  • 循环次数可随训练动态增加;boundary operator 也能提升指数(幅度较小)
  • 数据受限多轮训练下,随规模增加循环数是计算最优的
原文:arXiv 2609.19107 →
02 Label-free Steering:把测试时强化学习压进偏置子空间——只优化约 10 万个偏置参数,MATH-500 达 76.67%、略超有监督标签版
测试时强化学习 参数高效 推理经济学
多数投票伪标签当奖励、主干冻结,只优化约 10 万个偏置参数,比全参数 TTRL 少 76,000× 参数;同一流程改进 MathVista/AI2D/LogicVista/MMAU 等视觉-语言与音频推理,学到的 steering 向量迁移到 4,500 道留出 MATH 题。为什么值得看:如果测试时适应只需十万分之一的参数和零标签,「部署时越用越聪明」的成本曲线被大幅拉低——推理经济学的新下界。
  • 多数投票伪标签当奖励、主干冻结,仅优化约 10 万偏置参数(少 76,000×)
  • MATH-500 达 76.67%,略超自家有监督标签复现版
  • steering 向量迁移到 4,500 道留出 MATH 题,同一流程覆盖视觉-语言与音频推理
原文:arXiv 2609.18587 →
03 One Axis, No Brake:多智能体「同伴压力」的天花板——只拦有害修正的「刹车」原理上等价于探测模型自我知识,而自我知识有 AUROC 0.64-0.89 的「墙」
多智能体 智能体安全 同伴压力
只保留有益修正、拦下有害修正的「刹车」原理上等价于探测模型自我知识,而自我知识远不完美(六个模型家族 AUROC 0.64-0.89);白盒导向模型自身的正确性方向也穿不过去——有害与有益修正同步移动;多数智能体初始错误时,辩论把共同错误放大为自信的错误共识,更多智能体、更多样模型、更强的成员都救不回来;有效的是修订前加信息,而非修订后过滤。为什么值得看:放在 OpenAI 六份失配报告的同周——披露框架管单模型行为,这篇管多智能体系统里错误如何互相放大。
  • 「刹车」等价于探测自我知识:六个模型家族 AUROC 0.64-0.89 的墙
  • 多数初始错误时,辩论放大共同错误为自信的错误共识——更多智能体救不回来
  • 有效干预是修订前加信息,而非修订后过滤
原文:arXiv 2609.18998(页面显示提交于 2026-07-17,09-17 列表首次出现)→
04 Capability Emergence Can Be Forecast:涌现能力可以按 seed 提前预测——前 token 头形成时间预测归纳头涌现,Spearman ρ=0.977、中位领先约训练量 15%
涌现 可预测性 能力治理
前 token 头的形成时间预测归纳头涌现时点,中位领先 975 步(约训练量 15%);conformal 区间覆盖 15/15 留出 seed,冻结规则经三个未见配置盲测通过预注册门控;80 次有效锚定运行给出乘法规则 t_event ≈ 1.19 × t_anchor。为什么值得看:「涌现不可预测」是配速之辩的底层论据之一——若涌现时点可带校准区间地预报,能力治理从「事后惊觉」变成「可排期的工程问题」。
  • Spearman ρ=0.977、中位领先 975 步(约训练量 15%)
  • conformal 区间覆盖 15/15 留出 seed;冻结规则三个未见配置盲测通过预注册门控
  • 乘法规则 t_event ≈ 1.19 × t_anchor(80 次锚定运行)
原文:arXiv 2609.19000(页面显示提交于 2026-07-17,09-17 列表首次出现)→
今日观察
前两篇动「训练侧的前提」——缩放指数可调、涌现可预报;后两篇动「部署侧的前提」——多智能体刹车有原理天花板、测试时适应成本骤降四个数量级。放在配速之辩第七天读:如果涌现时点可以带校准区间地预报,「不能慢下来因为不知道会涌现什么」的论证就被抽掉了一半地基——治理工具箱里第一次有了「日程表」这种东西。
一句话总结:当缩放指数可以被架构改写、涌现可以被日历预测,而多智能体的刹车被证明有原理天花板——「能力治理」第一次同时拿到了工具和边界。

开源解读

GitHub Trending · 日榜 + Python 日榜
今日焦点
纯 C、零依赖跑 744B-2.8T 参数 MoE 的 colibri 两个月冲上主榜第 15(今日 +873)——「大模型跑在小硬件」浪潮与「harness 生态」同榜并行;攻(Claude-Red)防(security-audit-skill)两侧安全技能生态同日繁荣;腾讯系两榜三仓连续第二日集中上榜。
1
JustVugg / colibri ★ 35.7k · 今日 +873 C · 主榜第 15

纯 C、零依赖运行前沿 MoE 模型——专家权重从磁盘流式加载,README 称支持 744B 至 2.8T 参数跑在自有硬件上;2026-07 创建、两个月冲上主榜。与 JustFit(24GiB 笔记本跑 200K 上下文,09-17 期已核待用)同属「大模型跑在小硬件」浪潮——当前沿模型全面 MoE 化,「推理下沉到本地」第一次有了工程路径,这是对算力军备竞赛叙事的一个民间回答。

2
affaan-m / ECC ★ 261k · 今日 +1,171 JavaScript

编码智能体 harness 性能优化系统:skills/instincts/memory/security 全家桶,适配 Claude Code/Codex/Opencode/Cursor。与 AWS 系 strands-agents/harness-sdk(★ 7.3k)同期在榜——「harness 与技能生态」正成为模型层之后的新竞争层:谁能定义智能体的工作方式,谁就拿到下一个平台位。

3
SnailSploit / Claude-Red ★ 6.0k · 今日 +440 Python · Python 榜第 5

面向 Claude skills 体系的攻击性安全技能库,每个技能是一个结构化 SKILL.md。与防守侧 cloudflare/security-audit-skill(★ 10.7k,连续第三日千级日增)对看:安全技能生态在攻防两侧同时繁荣——技能系统正在成为安全能力的新分发格式。

4
Tencent / BrowserSkill ★ 4.2k · 今日 +1,302 Python · 主榜第 4

让智能体用用户真实登录态的浏览器干活。腾讯系两榜三仓连续第二日集中上榜的第一棒——浏览器即智能体的手脚,登录态即它的通行证。

5
Tencent / WeKnora ★ 26.3k · 回榜 TypeScript · 腾讯

知识平台 RAG/Wiki。与 09-17 期的 OpenViking、Octop 连起来看:国内大厂把智能体基建当开源产品线持续运营的趋势已经连续两周可见。

6
TencentCloud / Octop ★ 3.5k Python · 腾讯云

多用户多智能体自托管 AI 助手,连续第二日上榜。一家公司两榜三仓连挂两天——腾讯系在智能体基建层的开源存在感,本周超过了多数创业公司。

7
arnegiacomo / fugleramme ★ 2.9k · 今日 +592 Python

树莓派 + 墨水屏 + 本地 AI 鸟类识别——本周最治愈项目:一个会自己认鸟的电子相框。在满是 harness 与安全审计的榜单里,它提醒你本地推理最终的用途可以只是生活。

一句话总结:colibri 用纯 C 证明 2.8T 参数也能塞进自有硬件,Claude-Red 与 security-audit-skill 攻防同榜,腾讯系三仓连续两日——推理下沉、harness 生态、安全技能化三条线同时成型。