9 月 16 日
共收录 17 条(头条 5 + 精选 12) · 11 个信源
数据来自 AI HOT / Arena / Artificial Analysis / Google AI / HuggingFace Papers / Latent Space / OpenAI Blog / OpenRouter / SemiAnalysis / Simon Willison / arXiv cs.AI
01今日重点5 条
OpenAI 推出 ChatGPT Ads 新功能:Sponsored Agents 测试并集成 HubSpot 与 Shopify
OpenAI 为 ChatGPT Ads 推出多项 AI 驱动的新体验。Sponsored Agents 允许用户在点击广告后与明确标识的商业赞助智能体对话,目前在美国部分广告主中测试。
AI HOT· 当日· 单源未证实
Fyxer 如何打造出深受用户信赖的 AI 高管助理
Fyxer 利用 OpenAI 模型、微调、记忆功能以及真实用户反馈来整理收件箱,并以每位用户的语气起草邮件。
AI HOT / OpenAI Blog· 09-14· 2 源共振
[AINews] Jev:一个只做决策/分类/路由/评分的“System 1 模型”——比小型前沿 LLM 快 100 倍以上、便宜 200 倍以上
AIEi Paris(9月23-24日)和 AIE NYC(10月12-14日)门票已售出超过 50%,接下来是 AIE CODE(11月10-12日,旧金山)和 AIEi Shanghai(11月5-6日),随后 AIEi Sydney(12月7-8日,与 NeurIPS 同期)为今年收官!一家新创业公司的发布能登上头条新闻是非常罕见的,尤其是在这样一
Latent Space· 当日· 单源未证实
Anthropic 与 OpenAI 提议协调放缓前沿 AI 开发,Cohere CEO 等批评者质疑其真实动机
Anthropic CEO Dario Amodei 呼吁行业与政府协调放缓前沿 AI 开发,并寻求反垄断豁免,Sam Altman 与 Elon Musk 表示同意。
AI HOT / Latent Space· 昨日· 2 源共振
ImpossibleRubrics:对生成的评分准则作为奖励信号进行压力测试
语言模型生成的评分准则(rubrics)正越来越多地被用作基于评分准则的强化学习、LLM-as-a-judge 评估以及自动评分的奖励信号。此类评分准则只有在对诚实回答给予的奖励高于针对其漏洞优化出的对抗性回答时,才是可靠的。然而,它们对此类优化的鲁棒性仍缺乏充分了解。我们聚焦最困难的场景:不可能完成的任务,即提示词迫使模型得出缺乏依据的结论,此时唯一诚实的回应是……
arXiv cs.AI / HuggingFace Papers· 昨日· 2 源共振
02模型发布/更新1 条
Google DeepMind 发布 Gemini 3.8 Live 和 3.8 Live Extended Thinking
Google DeepMind 发布 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking 两个近实时语音对话模型,主打语音智能体和复杂任务执行。
AI HOT· 当日· 单源未证实
03产品发布/更新3 条
04行业动态1 条
人人都说数据中心禁令正在扼杀美国建设热潮,我们绘制了全部 300 个禁令的地图
20GW 位于受限的本地边界内,1525MW 实际受阻延误,全美范围内(包括纽约)共计 2.3GW
SemiAnalysis· 当日· 单源未证实
05技巧与观点1 条
Gemini Live 音频
工具:Gemini Live 音频。Google 今天发布了 Gemini 3.8 Live 和 3.8 Live Extended Thinking——两款与 OpenAI 的 GPT-Live 系列形态类似的语音到语音新模型。我让 GPT-6 Astra Extra High 阅读文档,为我构建了这个 Web UI。
Simon Willison· 当日· 单源未证实
R榜单速览数据快照
榜单页当天的快照,编号为榜内名次。只列名称与指标,不给出条目链接 —— 榜单行的 URL 是榜单页本身。
Arena
榜单页 ↗- claude-fable-5(Arena 文本总榜第 1 名)综合1 · 专家1 · 难题2 · 代码1 · 数学1 · 创作1 · 指令2 · 长查询2
- claude-opus-4-6-high(Arena 文本总榜第 2 名)综合2 · 专家2 · 难题1 · 代码3 · 数学6 · 创作2 · 指令1 · 长查询1
Artificial Analysis
榜单页 ↗- Claude Fable 5.1 (max with fallback)智能指数 53 · 每任务 $7.63 · 输出 66 tok/s · 首字延迟 234.98s · 上下文 1M · 厂商 Anthropic
- GPT-6 Astra (max)智能指数 53 · 每任务 $3.26 · 输出 54 tok/s · 首字延迟 308.27s · 上下文 1M · 厂商 OpenAI
OpenRouter
榜单页 ↗- GPT-5.6 Luna(OpenRouter 调用量第 1 名)17.4T tokens,占比 21%
- Hy4 预览版(OpenRouter 调用量第 2 名)13.6T tokens,占比 27%
另有 134 条因篇幅控制未展示 —— 这部分是低分长尾,没有进日报正文。