GPT-6 + Intelligent UI 向所有 ChatGPT 用户推送
OpenAI 把 GPT-6 和 Intelligent UI 推给全部 ChatGPT 用户:回答不再只是文字,模型可以直接生成可交互的界面、图表和小工具。负责人 Michelle Pokrass 称这是「押注模型智能」,让 GPT-6 自己填满画布;Tibo 说背后做了大量模型和基础设施优化以支撑 12 亿用户。对电商内容来说,「答案即界面」意味着商品对比、导购卡片可能直接由模型现场生成。
OpenAI 把 GPT-6 和 Intelligent UI 推给全部 ChatGPT 用户:回答不再只是文字,模型可以直接生成可交互的界面、图表和小工具。负责人 Michelle Pokrass 称这是「押注模型智能」,让 GPT-6 自己填满画布;Tibo 说背后做了大量模型和基础设施优化以支撑 12 亿用户。对电商内容来说,「答案即界面」意味着商品对比、导购卡片可能直接由模型现场生成。
Anthropic 发布 Haiku 5.5,定位高并发、低延迟任务:1M 上下文、128k 最大输出、支持自适应思考;平均运行成本比 Haiku 4.5 低约 75%,100k token 以内便宜 10 倍。官方推荐把它作为 Opus/Sonnet 5.5 的子智能体,做摘要、压缩、数据库查询等高量任务。当天已上 Claude Code、Cursor、Bedrock 等,@claudeai 首发帖 265 万浏览。
同一天 Anthropic 还把 Sonnet 5.5 缓存读取价格减半到 $0.10/百万 token(长任务约便宜 20%),并给 Max/Team 套餐每月附送 API 额度(Max 5x $100、Max 20x $200、Team 最高 $500 共享),Claude 初创计划也放宽到无需 VC 背书。叠加 Haiku 5.5,这是在模型成本端主动出击,对需要大规模调用模型的业务(如商家内容批量生成)是实打实的降本。
Claude 的 Python 和 TypeScript SDK 现在自带 computer use 与 browser use 工具类(beta):SDK 负责跑工具循环、执行你设定的 URL 和文件策略,开发者只需对接自己的浏览器或桌面驱动,不必再手写点击/键入映射。做浏览器自动化类智能体的门槛进一步降低。
Codex 负责人 Tibo(@thsottiaux)在「日更第 3 天」里披露,Codex 与 ChatGPT Work 合计活跃用户创下 4000 万新高,并给所有付费账号发放一次额度重置。前一天社区投票选择「重置额度」而不是四项新功能,也说明额度仍是开发者最在意的点。
Noam Brown 认为大模型已在部分研究问题上超过顶级人类专家,「刚好低于」和「刚好高于」人类水平差别巨大,所以数学成果显得突然爆发;Mark Chen 称这一轮相当于「一周完成十年数学进展」。X 热帖显示,有人让 GPT-6.1 Astra 循环运行,把 OpenAI 公开题 #109(整数乘法)的界从 2⁻¹⁸² 收紧到 2⁻⁵⁹,几小时刷新一次。
Google Labs 推出实验平台 Playground,零代码描述即可生成、游玩和分享自制游戏(美国 18+,帖子 223 万浏览);SynthID Detector 向所有人开放,可检测内容是否由 Google 或 OpenAI、NVIDIA、Kakao 等合作方工具生成,Apple 即将加入。DeepMind 还发布了开源多模态嵌入模型 EmbeddingGemma 2,并宣布与 CZI 合作「虚拟生物学计划」。
一条 24 万浏览的热帖引用马斯克声明:今后 SpaceX 的 Grok @Bot 会为每个任务选用最好的后端模型,包括 Claude Opus 5.5、MidJourney、Suno 等。头部玩家公开走「多模型路由」路线,说明应用层竞争正从「自研模型」转向「编排最优模型」。同日 Grok 4.7 也上线了微软 Foundry。
OpenAI 官方案例:Radisson 酒店集团与埃森哲合作,用 OpenAI 技术做了 ChatGPT 插件,让旅客在规划行程时直接在 ChatGPT 里查找、比较、预订酒店。又一个「交易入口进入对话」的落地样本,与 Intelligent UI 叠加后值得电商侧持续跟踪。
Tibo 说今天的重头戏是 ChatGPT 里的 GPT-6,同时 Codex 与 ChatGPT Work 合计活跃用户达到 4000 万新高,为庆祝给所有付费账号加载一次「存档的额度重置」。
第 2 天交付了四项更新和一些数学证明,但投票结果是大家要额度重置;他调侃「规则似乎偏向重置」,并宣布重置已完成。140 万浏览。
「不止于文字」:大量模型和基础设施改进汇合,才能把它扩展到 12 亿用户。
平均运行成本比 Haiku 4.5 低约 75%;适合与 Opus 5.5 或 Sonnet 5.5 搭配作为子智能体,处理摘要、上下文压缩、数据库查询等高量、对成本敏感的任务。
Python 和 TypeScript SDK 已内置 computer use / browser use:API 告诉你 Claude 想点哪里、输入什么,SDK 负责跑循环并把动作发给驱动,以前这些要自己写。
Boris Cherny 转发 @ClaudeDevs:Max 5x 每月 $100、Max 20x $200、Team 最高 $500(团队共享),可用于任意模型(含 Haiku 5.5),在自己的代码或第三方工具里都能用。80 万浏览。
100k token 上下文内,它比 Haiku 4.5 便宜 10 倍。
转发 @lydiahallie:API 计费用户可以在 Claude Code 里用 /model haiku 加 /autocompact 100k,让上下文保持在更便宜的价格档;设置按模型保存,只影响 Haiku(含子智能体)。
Thariq 说大家很喜欢 Haiku,5.5 版本 100k token 以内比 4.5 便宜 10 倍,推荐用在电脑操作、工作流和 API 场景。
很多人把做游戏当成娱乐并愿意为此付费(呼应当天 Google Playground 和「让 Claude 做游戏」的热帖)。
Alex Albert 对比两代 Haiku 的评测表,提醒 Haiku 4.5 是 2025 年 10 月 15 日发布的。他还转发了 Sonnet 5.5 缓存读取降价一半到 $0.10/百万 token 的消息(66 万浏览)。
Cat Wu 分享用法:问 Claude「上周谁用某功能最多?做一个前 10 名的 artifact,然后联系他们约 15 分钟聊聊」,是最快拿到用户反馈的方式。
短请求成本比 Haiku 4.5 低 10 倍,在 Cursor Settings > Models 开启。
Noam Brown:能力多年稳步提升,但在科学发现里「略低于」和「略高于」顶级人类差别巨大,这解释了数学成果为何突然爆发。能力仍不均衡,但预计其他领域会跟着突破,进入科学发现新时代。
Mark Chen 说 Navier-Stokes 这件事的意义更在于那张进展曲线图;接下来想把这些工具用在生命科学、训练下一代模型和对齐上。
Demis 称 AI 最重要的应用是改善医学和人类健康,对与 Chan Zuckerberg Initiative 的合作非常兴奋。他也转发了 SynthID Detector 向所有人开放的消息。
Jim Fan:派对后回家发现屋子被收拾干净、分不清是人还是机器人干的,这一天比数学难题更远;大家对莫拉维克悖论的认识还不够。
Intelligent UI 让日常问题的回答更可视化、复杂话题更易懂,并能现场给出可交互的任务工具。223 万浏览。OpenAI 还转发了负责人 Michelle Pokrass 的说明:这是押注模型智能,为此专门设计了省 token、即时流式渲染、符合设计语言的界面工具。
Sam Altman 为 Intelligent UI 站台,50 万浏览。
ChatGPT 新能力:用完全可交互的界面快速作答。Mark Chen 补充说每次回复都可能生成定制 UI,特别适合学习新东西。
未成年账号自动启用 ChatGPT for Teens,默认开启保护;即将推出 College Planner,帮美国高中生汇总申请要求、截止日期和助学金步骤,并新增闪卡、测验等学习工具。
Anthropic 官方账号发布最新模型 Haiku 5.5。
Grok 4.7 现已在 Microsoft Foundry 可用。
Alexandr Wang 宣布 Muse 的 iPad 应用发布,称界面「非常顺滑」,大屏给了更多空间。
过去 48 小时 Anthropic News、Cursor 博客和更新日志无新条目。今天修复了两处抓取问题:OpenAI Developers Changelog 页面结构变化导致前两天解析为 0 条,已改好;DeepMind RSS 改为压缩返回导致今早一度为空,也已处理。
GPT-6 在 ChatGPT 全球推送,配合 Intelligent UI 带来更快的回复和可直接操作的可视化、交互体验。
Radisson 与埃森哲合作,用 OpenAI 技术做 ChatGPT 插件,让旅客在规划行程时查找、比较、预订酒店。
College Planner 即将进入 ChatGPT for Teens,帮学生管理大学申请;同时推出闪卡、测验和青少年 AI 委员会。
把前沿模型与企业知识连接起来,帮助团队规划、构建和交付工作。
量化机构用更长时间运行的 AI 工作流整合多源数据,并保留人工审核。
OpenAI 与合同平台 Ironclad 在复杂合同工作流上训练和评估智能体,推进面向专业工作的电脑操作能力。
chat-latest 已更新为 ChatGPT 付费用户使用的最新模型;生产环境仍建议用 GPT-6 系列,chat-latest 适合测试聊天场景的最新改进。
面向高并发、低延迟任务的最强 Haiku:1M 上下文、128k 最大输出、支持自适应思考和 effort 参数;已上 Claude API、Amazon Bedrock 等。
提示缓存读取价从每百万 token $0.20 降到 $0.10(基础输入价的 0.05 倍);缓存写入及其他价格不变。
Python 和 TypeScript SDK 提供可继承的工具类,SDK 负责工具循环和你设定的 URL、文件策略。
Claude Max 和 Team 用户可按文档领取每月 API 额度。
受限网络环境的 allowed_hosts 现在同样作用于网页搜索和抓取工具,不匹配的地址会返回 url_not_allowed。
面向 Claude Enterprise,用现有 Compliance Access Key 即可检索和删除统一 Claude 体验里的对话。
DeepMind 发布第二代 EmbeddingGemma,开放、轻量,支持多模态嵌入(RSS 未附摘要)。
实验性游戏平台,可以创建、游玩和分享自制游戏。
热门搜索返回 20 条。已去掉与名单重复的帖子(@thsottiaux、@OpenAI、@gdb、@demishassabis),以及低信号内容:AI 生成的莫奈「真实录像」段子、Flova 视频推广、数据中心用水争论、两条低互动的推广帖。未发现中文注册推广帖。
Anthropic 官方称平均运行成本比 Haiku 4.5 低约 75%。今天全网最热 AI 帖,265 万浏览、3.4 万赞。
「想得到就能玩到」:零编程经验也能创建自己的游戏,美国 18+ 用户可用。
Roblox 早期开发者转发「让 Claude 在 GTA 5 里做个 Roblox」的演示,调侃 AI 做游戏。
引用 Claude 宣布 Sonnet 5.5 缓存读取降价一半(长任务约便宜 20%)的帖子,惊呼「Anthropic 疯了」,代表了开发者对这轮降价的情绪。
引用马斯克声明:今后会为每个任务选用最可能带来最好结果的后端,包括 Claude Opus 5.5、MidJourney、Suno 等。
引用的更新称:OpenAI 公开题 #109 的 κ 从 OpenAI 原始结果 2⁻¹⁸² 收紧到 2⁻⁵⁹,比原结果提升 2¹²³ 倍。
作者称 5 分钟就通过:一年 Claude Team、API 额度、优先限流和工具优惠;用公司邮箱在 Claude Console 申请。59 万浏览。
开发者指出可把 Max/Team 附送的 API 额度生成 key,接入 Vercel AI Gateway 等第三方工具使用。
研究者感叹大模型能力跃迁的速度。
作者称近三年 81% 的重大数学发现由 OpenAI 一天内公布,认为每个科学领域终将经历同样的变化(观点偏激,仅作情绪参考)。
论文按 Hugging Face 点赞数排序取前 10 篇(共抓到 50 篇)。
GitHub Trending 今天被「智能体技能包」刷屏(skills、agent-skills、diagram-design、security-audit-skill 等),技能生态正在快速成形。openGym(健身记录)与 AI 关系不大,已剔除。
师生模型分词器不同时,在线策略蒸馏需要序列和词表两级对齐。作者发现扩大对齐覆盖面帮助不大,严格 1:1 对齐已覆盖大部分,关键在监督信号是否可靠。今日点赞第一。
用 FP4 低精度做 RL rollout 能省算力和显存,但训练与 rollout 路径的量化误差不一致。TRACE 直接缩小两条路径的差异。
新基准要求智能体读缺陷规格、看代码库、实现分析器逻辑并反复编译迭代,考察端到端完成真实工程任务的能力。
研究智能体「先有证据再行动」的链条在哪里断裂。十种模型和框架组合中,静态判断好不代表交互执行可靠。
机器人磨损、负载变化会让实际动作偏离指令。提出部署时自适应方法,无需奖励和标注就能让 VLA 策略预先补偿误差。
用模型内部的统一机制,同时覆盖从单个长提示到整个语料库的证据选择,把 RAG 和长上下文合二为一。
企业 RAG 系统上线前要决定发布、修改还是拦截。该框架在工业评估中落地,把缺失数据和裁判模型误差也纳入决策。
做了一个办公室模拟器,研究智能体如何协作运营一家公司,以弥补企业长期数据稀缺、无法观察替代决策结果的问题。
现有在线策略蒸馏只看逐 token 一致性,作者引入轨迹级、按难度决定何时让教师介入的机制。
RL 训练推理时,难题奖励稀疏会卡住。该方法自适应地给出部分理由作为脚手架,帮助模型找到正确轨迹。
用智能体做逆向工程,从应用行为一直到原生二进制。连续第二天新增星最多。
Matt Pocock 公开自己 .agents 目录里的工程师技能包。
给 Claude Code、Codex、Copilot 等用的编辑风格图表设计技能,42 种图表,输出独立 HTML + SVG。
Addy Osmani 的生产级 AI 编程智能体技能集。
让编程智能体别把答案埋在长篇大论里的技能,输出「结论先行」。
跨会话持久记忆:记录智能体的操作、用 AI 压缩,再在后续会话注入相关上下文。
Cloudflare 出品的编程智能体安全审计技能,多阶段审计,结论可独立验证、机器可读。
开源电脑操作 2.0 基础设施:驱动、跨系统集群和基准,用于训练、评估和数据生成。
基于 Ghostty 的开源 macOS 终端,竖排标签和通知,专为多开 AI 编程智能体设计。
最近发帖时间和 24 小时/7 天计数来自每个账号最近约 20 条时间线,发帖很频繁的账号(如 @thsottiaux、@alexandr_wang)7 天计数可能偏低。
| 账号 | 分组 | 最近发帖(北京) | 24h | 7d | 状态 |
|---|---|---|---|---|---|
| @bcherny | 编程智能体/Codex & Claude Code | 2026-10-08 07:44 | 4 | 17 | 正常 |
| @thsottiaux | 编程智能体/Codex & Claude Code | 2026-10-08 03:19 | 3 | 20 | 正常 |
| @sama | 行业观点 | 2026-10-08 04:01 | 3 | 10 | 正常 |
| @OpenAI | 产品发布 | 2026-10-08 05:06 | 3 | 6 | 正常 |
| @alexandr_wang | 行业观点 | 2026-10-07 23:42 | 2 | 20 | 正常 |
| @trq212 | 编程智能体/Codex & Claude Code | 2026-10-08 06:12 | 2 | 13 | 正常 |
| @demishassabis | 模型与研究 | 2026-10-07 23:53 | 2 | 12 | 正常 |
| @ClaudeDevs | 编程智能体/Codex & Claude Code | 2026-10-08 04:07 | 2 | 6 | 正常 |
| @gdb | 模型与研究 | 2026-10-08 02:21 | 2 | 2 | 正常 |
| @markchen90 | 模型与研究 | 2026-10-08 05:33 | 2 | 2 | 正常 |
| @alexalbert__ | 编程智能体/Codex & Claude Code | 2026-10-08 03:18 | 2 | 2 | 正常 |
| @cursor_ai | 编程智能体/Codex & Claude Code | 2026-10-08 02:14 | 1 | 5 | 正常 |
| @AnthropicAI | 产品发布 | 2026-10-08 02:01 | 1 | 3 | 正常 |
| @SpaceXAI | 产品发布 | 2026-10-07 08:04 | 1 | 3 | 正常 |
| @polynoamial | 模型与研究 | 2026-10-08 05:32 | 1 | 2 | 正常 |
| @_catwu | 编程智能体/Codex & Claude Code | 2026-10-08 06:52 | 1 | 1 | 正常 |
| @DrJimFan | 模型与研究 | 2026-10-07 22:36 | 1 | 1 | 正常 |
| @mustafasuleyman | 行业观点 | 2026-10-06 22:16 | 0 | 6 | 正常 |
| @karpathy | 模型与研究 | 2026-10-02 14:35 | 0 | 2 | 正常 |
| @SebastienBubeck | 模型与研究 | 2026-10-07 06:39 | 0 | 1 | 正常 |
| @lilianweng | 模型与研究 | 2026-10-07 07:23 | 0 | 1 | 正常 |
| @OfficialLoganK | 产品发布 | 2026-10-07 02:07 | 0 | 1 | 正常 |
| @mntruell | 产品发布 | 2026-10-02 03:06 | 0 | 1 | 正常 |
| @nickaturley | 产品发布 | 2026-05-06 16:09 | 0 | 0 | 长期不活跃 |
| @janleike | 行业观点 | 2026-09-11 01:31 | 0 | 0 | 长期不活跃 |
| @amanrsanger | 编程智能体/Codex & Claude Code | 2026-08-12 23:52 | 0 | 0 | 长期不活跃 |