AI 日报

2026-10-07 · 覆盖时段 2026-10-06 08:06 → 2026-10-07 08:06(过去 24 小时;官方源放宽到 48 小时)
数据来源:X(twitterapi.io) · OpenAI/Anthropic/DeepMind/Google AI/Cursor · HF Daily Papers · GitHub Trending 今日花费(twitterapi.io):$0.0807 生成:2026-10-07 08:06 北京时间

来源异常:OpenAI Developers Changelog 页面本次仍解析到 0 条(连续第二天),疑似页面结构变化导致抓取失败;今天 Decisions API、API 档位等开发者更新改从 X 帖子补充。

模型与研究

OpenAI 公开内部前沿模型做出的一批数学新结果

OpenAI 发布「Sharing AI progress in mathematics」,公开一批由内部前沿模型在开放数学问题上得到的新结果,并在 GitHub(openai/math)放出 Lean 形式化证明和研究细节;发布方式参考了普林斯顿高等研究院(IAS)数学与 AI 独立顾问组的建议。Sam Altman 称「进入发现的新时代」,Noam Brown、Sébastien Bubeck、Lilian Weng 均转发。这是 AI 从「做题」走向「产出新科学结果」的标志性一步。

编程智能体

Codex 日更第 2 天:Auto-review 对 ChatGPT 账号免费,不占额度

Tibo(@thsottiaux)宣布,用 ChatGPT 账号登录的用户可免费使用 Auto-review(设置 > permissions > auto-review):由第二个智能体审查主智能体的所有操作,只拦截高风险或偏离用户意图的动作,从而能放心跑长任务,不必逐条批准。他说这项功能原本会占计划额度的 2%–10%。帖子 1.1 万赞、近 170 万浏览。

开发者平台

OpenAI Decisions API 公测:实时选择模型、工具或动作

OpenAI Developers 推出 Decisions API 公测,面向所有开发者,让应用近实时地决定该用哪个模型、工具或动作;官方称决策速度比通过 Responses API 调 GPT-6 Luna 快至多 10 倍。Tibo 说 OpenAI 自己也会用它改进产品,相当于一个实时通用分类器,对做智能体路由的团队很实用。

开发者平台

OpenAI API 付费档位从 5 档简化为 3 档,$500 即可进最高档

OpenAI API 用量档位合并为 Build、Launch、Grow 三档;新的最高档 Grow 只需累计付费 $500(原最高档需 $1,000),更容易拿到更高速率上限。这是 Codex 日更第 2 天的第 2 项,降低了中小开发者扩量的门槛。

开源模型

Mistral Large 4 发布:1T 参数、49B 激活、原生多模态,10 月底开放权重

Mistral 发布 Mistral Large 4(昵称 Le Chonk),总参数 1T、激活 49B,原生多模态;官方称它是美欧最强的开放权重模型,在网络防御、制造、金融等场景达到 SOTA,视觉定位超过闭源前沿模型。今天起 API 可用,开放权重计划 10 月底发布。Guillaume Lample 透露它在法国自建集群上用 3,800 张 NVIDIA Grace Blackwell GPU 训练。帖子 3.6 万赞、370 万浏览。

产品发布

Claude 进入 Google Docs、Sheets、Slides

Claude 官方宣布可在 Google Workspace 里以侧边栏形式工作:读取当前打开的文档并就地编辑,每次修改可先审批再落地;这些文件也能在 Claude 里打开。Boris Cherny(@bcherny)转发,这条在名单里浏览量最高(约 320 万)。对办公和内容运营场景是直接可用的能力。

产品发布

Anthropic 扩大网络安全验证计划,开放授权攻击类工作

Anthropic 扩大 Cyber Verification Program:通过验证的安全从业者可以使用 Claude Mythos 5.1、Opus 5.5 和 Sonnet 5.5,并配有面向防御工作的安全措施;还新增了允许授权攻击性工作(如渗透测试、红队)的档位。前沿模型在安全领域的分级开放正在成为常态。

编程智能体

Claude 走向「云端大脑 + 本地双手」:云会话可连本地文件夹

Claude Projects 云会话开始支持连接你批准的本地文件夹,只在任务需要时就地读写;ClaudeDevs 同时发布 Claude Code 云会话指南(每个任务一台新 VM、可并行、合上电脑也继续跑,含 7 种适用工作流)。Thariq(@trq212)总结方向:Claude 的「大脑」越来越多放在云端,再给它操作你电脑的「本地双手」。

产品发布

Google 发布 Nano Banana 2.1 图像生成与编辑模型,并降价

Logan Kilpatrick 宣布 Nano Banana 2.1 上线 API、AI Studio 和 Gemini App:画质更高、修复大量旧问题、价格更低;Google 官方称其在视觉设计、基于蒙版的编辑和主体一致性上明显提升。对电商素材、商品图编辑类业务值得马上测试。

开源模型

Google DeepMind 发布 EmbeddingGemma 2:首个原生多模态端侧嵌入模型

EmbeddingGemma 2 是开放的轻量级嵌入模型,把文本、代码、图像、音频和视频统一到同一向量空间,可在设备端运行。适合做多模态检索、商品素材检索等场景。

编程智能体

Cursor iOS App 可远程控制电脑上的本地智能体

Cursor 宣布可以用手机查看、回复本地电脑上运行的智能体,也能从 iOS App 发起新任务(Changelog「Remote control for local agents」)。编程智能体的「随时随地监工」正成为标配。

模型竞争

Grok 4.7 上线 Microsoft Foundry,马斯克称其擅长处理大型代码库

SpaceXAI 宣布 Grok 4.7 已在 Microsoft Foundry 上线;马斯克转引第三方账号 @XFreeze 的帖子,称 Grok 4.7 在 VulcanBench Frontier v4 上包揽前三(xHigh 93.15),超过 Opus 5.5、GPT-6 Astra、GPT-6.1 Sol 等。该榜单成绩来自第三方转述,未经官方核实。

编程智能体/Codex & Claude Code

@thsottiaux 2026-10-07 04:56 北京时间 ❤ 2598 · 👁 295992

Codex 日更第 2 天汇总:四项更新

Tibo 汇总第 2 天的四项交付:2.1 Auto-review(自动审查)免费、不占用额度(他说原本会占计划的 2%–10%);2.2 简化面向开发者的 API 档位;2.3 会议纪要接入;2.4 Decisions API 上线。随后他发起投票,问大家想要「四项更新还是一次额度重置,或者都要」。

@thsottiaux 2026-10-06 15:13 北京时间 ❤ 11812 · 👁 1693911

Auto-review 对 ChatGPT 账号免费

在设置 > permissions > auto-review 开启。默认沙箱需要逐条批准,容易审批疲劳;Auto-review 让第二个智能体审查主智能体的所有动作,只为阻止高风险操作和偏离原意的操作,从而可以放心跑长任务。该功能现在免费、不消耗计划额度。

@thsottiaux 2026-10-07 04:53 北京时间 ❤ 1815 · 👁 168732

Decisions API 公测

转引 @OpenAIDevs:Decisions API 面向所有开发者公测,让应用近实时选择合适的模型、工具或动作,决策速度比通过 Responses API 调 GPT-6 Luna 快至多 10 倍。Tibo 说 OpenAI 自己也会用它改进体验,「实时通用分类器」打开了很多可能。

@thsottiaux 2026-10-07 04:47 北京时间 ❤ 2087 · 👁 220803

ChatGPT 会议插件:会议内容可直接喂给 Codex

转引 @ChatGPT:Meetings 插件(Beta,面向 Pro 等用户)自动记会议笔记,并在 ChatGPT Space 里生成个性化摘要和下一步;笔记可私有或团队共享,还能让 ChatGPT 据此更新项目计划、起草跟进。Tibo 的角度是:开会时尽管聊,积累的上下文直接加载进 Codex 去执行。

@thsottiaux 2026-10-07 03:09 北京时间 ❤ 2219 · 👁 417250

API 档位从 5 档变 3 档

转引 @OpenAIDevs:付费档位合并为 Build、Launch、Grow;最高档 Grow 只需累计 $500 API 付费即可达到(原来最高档要 $1,000),更容易拿到更高速率上限。

@bcherny 2026-10-07 04:15 北京时间 ❤ 5455 · 👁 349449

Boris Cherny:和 Claude 说话就像和同事说话

Claude Code 负责人说提示词没有秘诀,大多数任务不需要过度脚手架或过度规定,给目标即可。在 Sonnet 3.5 时代提示词很关键,如今更重要的是讲清三件事:1)你要它做什么;2)希望它投入多少精力;3)它该如何验证自己做对了。

@ClaudeDevs 2026-10-07 02:42 北京时间 ❤ 1412 · 👁 159743

Claude Code 云会话实战指南

ClaudeDevs 发布指南:云会话为每个任务启动一台全新 VM,可同时开多个,合上电脑也继续运行;文中给出 7 种适合云会话的工作流,以及一次连通 GitHub 的方法。

@bcherny 2026-10-06 23:28 北京时间 ❤ 1111 · 👁 260060

Claude Projects 云会话可连接本地文件夹(转发)

Boris 转发 @dfeinition:Claude Projects 的云会话可以连接你批准的本地文件夹,会话留在云端,只在任务需要时就地读写本地文件,今天开始灰度。

@trq212 2026-10-07 05:16 北京时间 ❤ 342 · 👁 28366

Thariq:Claude 的「云端大脑 + 本地双手」

Thariq 表示 Claude 将越来越多地把「大脑」放在云端,再给它操作你电脑的「本地双手」;他在 Latent Space 播客上谈了 Claude Code 里这一机制的实现。

@trq212 2026-10-06 10:18 北京时间 ❤ 1858 · 👁 178914

用 HTML 方案技能做规划更省 token

Thariq 在做一个让 Claude Code 生成更好 HTML 计划的技能(简明语言、代码片段、列出待确认问题、做原型图,并用 lint 减少常见失败)。他补充:这种做法比让模型直接写原始 HTML 省 token,因为状态机、图表、代码片段等常用组件不必每次重造。

@trq212 2026-10-07 00:14 北京时间 ❤ 3341 · 👁 122306

Thariq:编程智能体不改变「理解底层」的必要

他认为在更高抽象层工作,一直都需要理解更低的层次,编程智能体并不改变这一点。3,300 多赞,也进了今天的热门榜。

@bcherny 2026-10-07 01:02 北京时间 ❤ 1025 · 👁 120158

Opus 5.5 做的播客互动伴读网站

Boris 让 Opus 5.5 为 Acquired 播客的 Home Depot 一集做了一个互动伴读网站,水彩插图也全由 Claude 绘制(Claude Artifact 链接见原帖)。

@bcherny 2026-10-07 04:10 北京时间 ❤ 10502 · 👁 1459949

Claude 初创公司计划扩大(转发)

转发 @claudeai:Claude Startups 计划向更多创始人开放,成员可获一年 Claude Team、API 额度、创业常用工具优惠,以及 Anthropic 应用 AI 团队的答疑时间。对考虑创业的人值得留意。

@cursor_ai 2026-10-07 07:46 北京时间 ❤ 165 · 👁 7485

Cursor:用手机控制电脑上的智能体

通过 Cursor iOS App 查看进度、回复或开启新任务,智能体仍跑在你自己的电脑上。

模型与研究

@OpenAI 2026-10-07 06:19 北京时间 ❤ 8304 · 👁 852023

OpenAI 发布内部前沿模型的一批数学新结果

OpenAI 公开由内部前沿模型产出的大量数学结果,发布方式参考了普林斯顿高等研究院(IAS)「数学与 AI 独立顾问组」的建议和公开建议;相关材料(含 Lean 形式化)放在 GitHub openai/math。@polynoamial、@SebastienBubeck、@lilianweng 均转发了这条。

@thsottiaux 2026-10-07 06:24 北京时间 ❤ 2090 · 👁 137889

Tibo:模型解决了一些重要数学问题

Tibo 说这与当天的产品发布无关,但「我们的模型确实解决了一些重要数学问题」,团队写成了博客,称之为「科学进步的非凡新纪元」。

@sama 2026-10-07 08:06 北京时间 ❤ 66 · 👁 6960

Sam Altman:我们正进入发现的新时代

Altman 转发数学成果博客,配文「We are entering a new era of discovery now」。

@demishassabis 2026-10-07 05:26 北京时间 ❤ 841 · 👁 46566

Demis Hassabis 点赞数学家 John Urschel

转引报道:前 NFL 球员、MIT 数学博士 John Urschel 据报帮助解决了一个与高斯消元相关的长期猜想;Hassabis 称他是「激励人心的人」。与 AI 无直接关系,作为当天「数学」话题的旁证。

产品发布

@OfficialLoganK 2026-10-07 02:07 北京时间 ❤ 1412 · 👁 51485

Nano Banana 2.1 上线

Logan 宣布 Nano Banana 2.1:图像生成和编辑画质更高、修复大量旧问题、价格更低,已在 API、AI Studio 和 Gemini App 可用。Demis Hassabis 也转发了 Google 官方帖(称在视觉设计、蒙版编辑、主体一致性上全面超越旧模型)。

@AnthropicAI 2026-10-07 03:00 北京时间 ❤ 3008 · 👁 364810

Anthropic 扩大网络安全验证计划

验证过的安全专业人士可使用 Claude Mythos 5.1、Opus 5.5、Sonnet 5.5,并带有面向防御的安全措施;新增允许授权攻击性工作(渗透测试、红队)的档位。

@SpaceXAI 2026-10-07 08:04 北京时间 ❤ 38 · 👁 9368

Grok 4.7 上线 Microsoft Foundry

SpaceXAI 宣布 Grok 4.7 可在微软 Foundry 平台使用,企业客户多了一个接入渠道。

行业观点

@alexandr_wang 2026-10-07 00:26 北京时间 ❤ 826 · 👁 121564

Alexandr Wang 回应 Meta Muse 上《每日秀》

《The Daily Show》里 Jon Stewart 和 Meta 的 AI 智能体 Muse 对话调侃;Wang 吐槽「谁给它接的这个活」,随后又发帖称要「清空日程给 Muse 做媒体培训」。今天他的帖子以 Muse 相关的玩笑为主,信号不强,但能看出 Meta 在为 Muse 做大众层面的曝光。

@mustafasuleyman 2026-10-06 22:16 北京时间 ❤ 1211 · 👁 286634

Mustafa Suleyman 发布 X 长文

Suleyman 发了一篇 X 长文(链接 x.com/i/article),本次抓取只拿到链接,没有正文,内容需点开查看。

过去 48 小时内 Anthropic 文档更新、Google AI 博客、Cursor 博客无新条目(抓取正常)。OpenAI Developers Changelog 解析到 0 条,疑似抓取失败。Nano Banana 2.1 未出现在 Google 博客 RSS 中,见「X 业界名单」。

OpenAI News 2026-10-06

Sharing AI progress in mathematics(分享 AI 在数学上的进展)

OpenAI 公布内部前沿模型在开放数学问题上的新结果,并在 GitHub 分享 Lean 形式化证明和研究细节。

OpenAI News 2026-10-07

Atlassian 与 OpenAI 扩大合作

把前沿模型和企业知识打通,帮助团队规划、构建和交付工作。

OpenAI News 2026-10-06

Jump Trading 用 ChatGPT 扩展量化研究

案例:用更长时运行的 AI 工作流整合多数据源,配合人工审核做量化研究。

OpenAI News 2026-10-06

与 Ironclad 合作推进 Computer Use

OpenAI 和 Ironclad 在复杂合同工作流上训练和评测 AI 智能体,推进面向专业工作的电脑操作能力。

OpenAI News 2026-10-05

OpenAI 应对欧盟文本溯源规则的做法

说明在欧盟规则下文本水印的适用范围、检测方式,以及为何先向研究人员开放检测。

OpenAI News 2026-10-05

为人们使用 AI 的方式打造广告

ChatGPT 推出新的视觉广告格式,扩展效果衡量工具、归因合作和品牌安全设置。对电商广告投放是值得关注的新渠道。

Anthropic News 2026-10-06

扩大网络安全验证计划(Cyber Verification Program)

验证过的安全从业者可使用 Claude Mythos 5.1、Opus 5.5、Sonnet 5.5,新增授权攻击性工作档位。

Google DeepMind Blog 2026-10-07

EmbeddingGemma 2:开放、轻量的多模态嵌入模型

首个原生多模态端侧嵌入开放模型,统一文本、代码、图像、音频和视频。

Cursor Changelog 2026-10-06

Remote control for local agents(远程控制本地智能体)

在 Cursor iOS App 里查看并回复电脑上运行的本地智能体。

论文按 Hugging Face 点赞数排序取前 11 篇(共抓到 50 篇)。

GitHub Trending 的「AI 相关」仓库里,openGym(健身记录)与 AI 关系不大,已剔除。

Hugging Face Daily Papers

论文 ▲ 28 upvotes

In-Distribution Forcing:测试时生成长视频

自回归视频扩散模型生成长视频会「漂移」(颜色纹理走样、动作衰减)。作者指出根源是缓存的 KV 本身超出训练分布,提出测试时框架 ID-Forcing,用「自缓存」让滚动窗口始终保持分布内,从而把短视频模型无缝延长。

论文 ▲ 24 upvotes

LMBuild:评测 LLM 智能体能否设计「造得出、能用」的结构

现有 3D 生成评测偏重几何质量。LMBuild 把物体表示为带零件、关节、材料和装配顺序的结构,提供交互环境、基于 CAD 数据集的基准和覆盖结构稳固性、功能、设计和物理可实现性的评测框架。

论文 ▲ 20 upvotes

主动型智能体的基础:原则、技术层与 Proactivity-Gym

提出主动型 LLM 智能体的三条原则(任务能力、时间分配、信任),梳理五个设计维度,并给出可模拟多日场景、带人格化模拟用户的评测环境 Proactivity-Gym。和「智能体在用户开口前先干活」的产品方向直接相关。

论文 ▲ 19 upvotes

自生成反馈会破坏测试时训练(TTT)

模型在推理时用自己生成的文本更新权重,会在 128K token 长流上让它对真实人类文本的预测变差;用冻结模型生成训练块可消除 98% 以上损伤。对长时程自我适应、自我学习的智能体是重要警示。

论文 ▲ 17 upvotes

让语言模型改进优化器:更快的分子结构弛豫

智能体通过「自动研究」重写几何优化器,从最快的开源优化器 Sella 出发得到 AutoSella;在 r2SCAN-3c DFT 级别上,只需 Sella 40.2%–77.2% 的力计算次数就达到同样的能量下降。又一个「AI 做科研」的实例。

论文 ▲ 16 upvotes

通过逆向蒸馏做数据遗忘

IDU 把多步扩散/流模型蒸馏成一步生成器的同时,压制指定训练子集的输出,只需全量教师模型和待遗忘数据。

论文 ▲ 16 upvotes

扩散语言模型的表征空间 MMD 后训练

在冻结预训练扩散语言模型的特征空间里最小化 MMD 做后训练,不需完整采样轨迹;在 16B 模型上提高解码并行度,数学和代码精度持平或更高。

论文 ▲ 14 upvotes

SearchJev:搜索智能体的快速「系统 1」决策模型

把相关性、证据是否足够等短决策交给不需自回归生成的打分模型,不确定时再交给「系统 2」推理;决策速度提升 5.2–5.3 倍,校准误差更低。

论文 ▲ 12 upvotes

OmniReasoning:音视频联合推理

发布必须同时用音频和视觉证据才能回答的基准(1,150 题)、自动构建数据的引擎,以及 11.2 万 SFT 和 1.9 万 RL 训练数据和一种自蒸馏方法。

论文 ▲ 11 upvotes

RobotUse:机器人智能体的执行框架

智能体只负责视觉选目标和位姿,后端处理几何、运动规划和控制,并用持续更新的「操作手册」从执行中学习;在 RoboLab 上任务成功率 45%,比 CaP-X 高 6.7 个百分点。

论文 ▲ 8 upvotes

UndoBench:区分智能体的任务能力和出错恢复能力

覆盖 8 个企业领域的 36 个工作流和 36 种故障场景,单独衡量工具型智能体出错后的恢复能力。

GitHub Trending(AI 相关)

开源 ★ +2956 today

morluto/rea

用智能体做逆向工程,从应用行为一直到原生二进制。今日新增星最多。

开源 ★ +889 today

mattpocock/skills

Matt Pocock 公开自己 .agents 目录里的工程向技能合集。

开源 ★ +623 today

msitarzewski/agency-agents

一整套带人设和流程的专业智能体(前端、社区运营、审核等),像一家「AI 代理公司」。

开源 ★ +619 today

earthtojake/text-to-cad

给智能体加上 CAD 建模能力,文字生成 CAD。

开源 ★ +616 today

pbakaus/impeccable

让 AI 编程工具更会做设计的「设计语言」。

开源 ★ +534 today

thedotmack/claude-mem

跨会话持久记忆:记录智能体的操作、用 AI 压缩,再把相关上下文注入后续会话;支持 Claude Code、Codex、Gemini、Copilot 等。

开源 ★ +326 today

ayghri/i-have-adhd

一个让编程智能体别把答案埋在长篇大论里、结论先行的技能。

开源 ★ +228 today

cathrynlavery/diagram-design

给 Claude Code、Codex、Copilot 等用的编辑风图表设计技能,42 种图表,输出独立 HTML + SVG。

开源 ★ +199 today

deepseek-ai/DeepGEMM

DeepSeek 开源的高效 GPU 矩阵乘(GEMM)内核库。

最近发帖时间和 24 小时/7 天计数来自每个账号最近约 20 条时间线,发帖很频繁的账号(如 @thsottiaux、@alexandr_wang)7 天计数可能偏低。

账号分组最近发帖(北京) 24h7d状态
@thsottiaux编程智能体/Codex & Claude Code2026-10-07 06:24920正常
@bcherny编程智能体/Codex & Claude Code2026-10-07 04:15613正常
@alexandr_wang行业观点2026-10-07 04:05420正常
@trq212编程智能体/Codex & Claude Code2026-10-07 05:16413正常
@demishassabis模型与研究2026-10-07 05:26216正常
@sama行业观点2026-10-07 08:0618正常
@mustafasuleyman行业观点2026-10-06 22:1617正常
@ClaudeDevs编程智能体/Codex & Claude Code2026-10-07 02:4215正常
@cursor_ai编程智能体/Codex & Claude Code2026-10-07 07:4615正常
@OpenAI产品发布2026-10-07 06:1914正常
@SpaceXAI产品发布2026-10-07 08:0413正常
@polynoamial模型与研究2026-10-07 06:2912正常
@OfficialLoganK产品发布2026-10-07 02:0712正常
@AnthropicAI产品发布2026-10-07 03:0012正常
@SebastienBubeck模型与研究2026-10-07 06:3911正常
@lilianweng模型与研究2026-10-07 07:2311正常
@karpathy模型与研究2026-10-02 14:3502正常
@mntruell产品发布2026-10-02 03:0601正常
@_catwu编程智能体/Codex & Claude Code2026-09-29 02:2900正常
@nickaturley产品发布2026-05-06 16:0900长期不活跃
@gdb模型与研究2026-09-29 14:3100正常
@markchen90模型与研究2026-09-22 16:3500长期不活跃
@alexalbert__编程智能体/Codex & Claude Code2026-09-29 02:0600正常
@janleike行业观点2026-09-11 01:3100长期不活跃
@DrJimFan模型与研究2026-09-04 10:1400长期不活跃
@amanrsanger编程智能体/Codex & Claude Code2026-08-12 23:5200长期不活跃

建议