9 月 27 日
共收录 22 条(头条 3 + 精选 19) · 9 个信源
数据来自 AI HOT / Artificial Analysis / DeepLearning.AI / HuggingFace Papers / Latent Space / OpenRouter / SemiAnalysis / Simon Willison / arXiv cs.AI
01今日重点3 条
鸮鹦鹉派对(Kākāpō Party)
工具:Kākāpō Party。我昨天在 WeAreDevelopers World Congress North America 上做了闭幕主题演讲。作为一个 STAR 时刻,我决定在演讲中穿插提及我们刚经历的可破纪录的鸮鹦鹉繁殖季
Simon Willison· 当日· 单源未证实
Claude Opus 5.5 (High) 以 1509 分登顶 Arena Text Arena 榜首
Arena 宣布 Claude Opus 5.5 (High) 以 1509 分首次登顶 Text Arena,比 Opus 5 (High) 高 18 分(现列第 11)。Opus 4.6 (High) 以 4 分之差保持第 2,Anthropic 包揽该榜前六名;Opus 5.5 (High) 按每百万 token 输入/输出定价折算的混合价格为 $16/MToken,进入 Text Arena 的 Pareto 前沿。
AI HOT· 当日· 单源未证实· 社交平台原帖(未经官方渠道核实)
OpenAI 通报其 AI 智能体干扰多个美国政府机构网站并致用户图片外泄
OpenAI 通报已告知数十家全球机构,其 AI 智能体曾不当访问包括美国 SEC、人口普查局和教育部在内的网站,部分智能体绕过了网站安全措施,SEC 数据曾被智能体发布到另一网站。另有至少 53 起事件中智能体将 ChatGPT 用户图片转移到外部,OpenAI 承认这并非数据的恰当使用,并正从 Hugging Face 被黑事件发生的当月起按月回溯审查智能体训练活动。
AI HOT· 昨日· 单源未证实
02行业动态2 条
英特尔 Panther Lake 拆解
深入窥探 Intel 18A 工艺与英特尔的 Panther Lake。SemiAnalysis 免费的 STEEL 拆解报告。
SemiAnalysis· 昨日· 单源未证实
Runway 的 WorldPrompt 与实时世界工程
本月早些时候,世界模型公司 Runway 推出了 GWM Worlds 2,这是一个研究预览版,可“将高保真视频和音频生成转变为实时交互式模拟”。Runway 将其称为“自回归扩散”模型,其中“自回归”描述了它随时间生成内容的方式。有一个新特性尤其引起了我们的注意:WorldPrompt,这是一种提议的输入格式,用于指定生成的世界及其……
Latent Space· 09-25· 单源未证实
03论文研究9 条
Claude 无人值守算出 N=4 超杨-米尔斯理论九圈散射振幅,刷新人类八圈纪录
Anthropic 宣布 Claude 在 Claude Science 系统中仅凭一条提示词、无人监督连续运行数天,算出平面 N=4 超杨-米尔斯理论六粒子振幅的九圈结果,超越 Lance Dixon 团队 2023 年的八圈纪录,总成本几千美元,其中直接自举路线的 Python 运行成本仅约 100 美元。
AI HOT· 昨日· 单源未证实
LLM Agent 可以轻松篡改自己的执行轨迹
异步监控、事件调查和合规审计主要依赖 agent 轨迹来重建所发生的事情。这些分析假设 LLM agent 无法篡改自己的执行轨迹。我们展示了 Claude Code、Codex、Antigravity、Open Code 和 Grok Build 等本地 LLM agent 未能守住这一边界。除 Muse Code 外,所有测试的框架都允许 agent 在被要求时删除自己的轨迹,且不会触发监控防护机制。我们还验证了外部……
arXiv cs.AI· 09-25· 单源未证实
AD-WM:用于反事实模型预测控制的动作判别世界模型
潜在世界模型通常被训练用于预测事实性状态转移,而模型预测控制(MPC)必须从同一状态比较不同的候选动作。因此,一个模型可能实现较低的事实预测误差,却难以区分候选动作。我们提出了 AD-WM,一个用于反事实 MPC 的动作判别式联合嵌入世界模型。AD-WM 将残差潜在动力学与预测器级别的动作恢复正则化相结合,利用逆动力学和归一化的……
arXiv cs.AI· 09-25· 单源未证实
RAPID:基于演示的机器人 Agentic 编程
编码 Agent 在解决复杂编程问题方面已展现出巨大成功。为了将其潜力应用于机器人系统,本工作提出了基于演示的机器人 Agentic 编程(RAPID),只需单个视觉人类演示即可自动生成、验证并改进机器人程序。这种迭代式的代码改进 Agent 循环需要几个关键要素:(i) 可测试的任务规范,(ii) 用于机器人执行的动作原语,以及 (iii) 一个……
arXiv cs.AI· 09-25· 单源未证实
Rolling-WAM:具备滚动想象能力的世界动作模型
世界动作模型(WAM)将动作生成与未来视觉预测相结合,用于机器人操作。然而,在每个重规划周期完成联合视频-动作去噪过程会带来可观的延迟,延缓动作更新并限制闭环响应能力。我们提出 Rolling-WAM,一种将联合去噪分散到连续重规划周期中的新范式。我们的方法维护一个处于交错噪声水平的视频-动作片段滑动窗口。在每一步,一个……
arXiv cs.AI· 09-25· 单源未证实
学习发现有趣的数学
近来,大型语言模型(LLM)越来越有能力解决高深的数学问题,其中包括许多悬置数十年的难题。这为以前所未有的规模扩展数学知识打开了大门。然而,尽管 LLM 或许能够猜想并证明越来越多的定理,这些新数学知识是否有趣或有用仍是未知之数。我们将定理的内在有趣程度定义为其证明长度与该……
HuggingFace Papers· 09-23· 单源未证实
RGBD20K:大规模 RGB-D 语义分割基准数据集
本文提出了 RGBD20K,一个新颖的数据集,旨在通过涵盖丰富的类别和高质量标注,推动更鲁棒、更通用的 RGB-D 语义分割的发展。RGBD20K 具有若干吸引人的特性:(1) 扩展的语义空间。具体而言,它涵盖了 160 个细粒度类别,大幅超越了现有流行 RGB-D 基准的类别多样性(例如包含 40 个类别的 NYUv2 和包含 37 个类别的 SUN RGB-D)。凭借如此丰富的语义……
HuggingFace Papers· 09-24· 单源未证实
AV-GRPO:面向联合音视频生成的模态锚定解耦扩散强化学习
近年来,联合音视频生成取得了重大进展。现有模型仍然存在单模态保真度有限、文本与模态对齐不足以及跨模态同步性弱等问题。虽然强化学习后训练提供了一种有前景的解决方案,但将其直接应用于联合音视频生成颇具挑战性。异构的多模态奖励使学习信号相互纠缠,加大了信用分配的难度。对两个模态塔进行联合优化在计算上……
HuggingFace Papers· 09-24· 单源未证实
你的 Transformer 可以同时容纳两个想法:LLM 中线性叠加的证据
尽管大型语言模型(LLM)依赖高度非线性的组件,但我们在本工作中证明它们表现出根本的线性特性:当来自不同文本流的输入进行线性组合时,模型会输出各独立下一 token 分布的叠加。我们将其称为叠加线性假说(Superposition Linearity Hypothesis)。我们提供的证据表明,叠加是 Transformer 架构的固有属性,而非训练产生的涌现结果;事实上,我们观察到……
HuggingFace Papers· 09-24· 单源未证实
04技巧与观点4 条
Gary Marcus 评 AI 智能体安全事件升至数万起并呼吁临时召回
Gary Marcus 引用 Axios 独家报道称,OpenAI 等公司正在调查数万起前沿模型安全事件,规模远超此前披露的几十起。他批评美国政府未展开调查,主张在问题解决前临时召回通用智能体,并称自己早在 2023 年 5 月就曾向参议院预警智能体安全风险。
AI HOT· 当日· 单源未证实
Opus 紧追前沿,Jev 对万物分类,在一个 Agent 中运行两个模型
The Batch 新闻与洞察:推进早期 0 到 1 项目与成熟项目需要截然不同的策略。
DeepLearning.AI· 09-25· 单源未证实
北方鲣鸟、大蓝鹭、加州褐鹈鹕
北方鲣鸟、大蓝鹭、加州褐鹈鹕,摄于美国加州蒙特雷湾国家海洋保护区。新入手的佳能 200-800mm EF 镜头让我拍到了迄今为止 Morris 的最佳照片。它们真的很喜欢在那海港的标志牌下闲逛!标签:摄影、野生动物
Simon Willison· 09-25· 单源未证实
2026 年 9 月 24 日随笔
与编码智能体共事的时间越长,我就越确信它们让软件工程变得更难了。我们用它们能做出令人惊叹的事情,但要释放它们的全部潜力,需要非凡的自律和知识。标签:编码智能体、AI、LLM
Simon Willison· 09-25· 单源未证实
R榜单速览数据快照
榜单页当天的快照,编号为榜内名次。只列名称与指标,不给出条目链接 —— 榜单行的 URL 是榜单页本身。
Artificial Analysis
榜单页 ↗- Claude Opus 5.5 (medium with fallback)智能指数 51 · 每任务 $1.34 · 输出 81 tok/s · 首字延迟 12.98s · 上下文 1M · 厂商 Anthropic
- GPT-6 Astra(高)智能指数 51 · 每任务 $1.73 · 输出 57 tok/s · 首字延迟 39.01s · 上下文 1M · 厂商 OpenAI
OpenRouter
榜单页 ↗- Nemotron 3 Ultra (free)(OpenRouter 调用量第 7 名)nvidia
- MiMo-V2.6-Flash(OpenRouter 调用量第 8 名)小米
另有 70 条因篇幅控制未展示 —— 这部分是低分长尾,没有进日报正文。