AI复利手记

9 月 16 日

共收录 17 条(头条 5 + 精选 12) · 11 个信源

数据来自 AI HOT / Arena / Artificial Analysis / Google AI / HuggingFace Papers / Latent Space / OpenAI Blog / OpenRouter / SemiAnalysis / Simon Willison / arXiv cs.AI

17
收录条目
5
头条
3
多源共振
134
未展示(低分)

01今日重点5 条

  1. OpenAI 推出 ChatGPT Ads 新功能:Sponsored Agents 测试并集成 HubSpot 与 Shopify

    OpenAI 为 ChatGPT Ads 推出多项 AI 驱动的新体验。Sponsored Agents 允许用户在点击广告后与明确标识的商业赞助智能体对话,目前在美国部分广告主中测试。

    AI HOT· 当日· 单源未证实

  2. Fyxer 如何打造出深受用户信赖的 AI 高管助理

    Fyxer 利用 OpenAI 模型、微调、记忆功能以及真实用户反馈来整理收件箱,并以每位用户的语气起草邮件。

    AI HOT / OpenAI Blog· 09-14· 2 源共振

  3. [AINews] Jev:一个只做决策/分类/路由/评分的“System 1 模型”——比小型前沿 LLM 快 100 倍以上、便宜 200 倍以上

    AIEi Paris(9月23-24日)和 AIE NYC(10月12-14日)门票已售出超过 50%,接下来是 AIE CODE(11月10-12日,旧金山)和 AIEi Shanghai(11月5-6日),随后 AIEi Sydney(12月7-8日,与 NeurIPS 同期)为今年收官!一家新创业公司的发布能登上头条新闻是非常罕见的,尤其是在这样一

    Latent Space· 当日· 单源未证实

  4. Anthropic 与 OpenAI 提议协调放缓前沿 AI 开发,Cohere CEO 等批评者质疑其真实动机

    Anthropic CEO Dario Amodei 呼吁行业与政府协调放缓前沿 AI 开发,并寻求反垄断豁免,Sam Altman 与 Elon Musk 表示同意。

    AI HOT / Latent Space· 昨日· 2 源共振

  5. ImpossibleRubrics:对生成的评分准则作为奖励信号进行压力测试

    语言模型生成的评分准则(rubrics)正越来越多地被用作基于评分准则的强化学习、LLM-as-a-judge 评估以及自动评分的奖励信号。此类评分准则只有在对诚实回答给予的奖励高于针对其漏洞优化出的对抗性回答时,才是可靠的。然而,它们对此类优化的鲁棒性仍缺乏充分了解。我们聚焦最困难的场景:不可能完成的任务,即提示词迫使模型得出缺乏依据的结论,此时唯一诚实的回应是……

    arXiv cs.AI / HuggingFace Papers· 昨日· 2 源共振

02模型发布/更新1 条

03产品发布/更新3 条

  • 来自 Google AI 与经济 ATLAS 的新洞察

    我们将 ATLAS 的数百万条全球数据点转化为一个可交互、开放访问的体验。

    Google AI· 昨日· 单源未证实

  • 创造社会影响力的 AI

    探索这一专题合集,了解专家和地方领导者如何利用 AI 突破性进展,确保每个人都能分享 AI 带来的机遇。

    Google AI· 当日· 单源未证实

  • 构建加速科学进步、改善人类生活的 AI

    衡量 AI 的真正标准在于它帮助了谁。以下介绍它当今如何改变人们的生活。我们专注于先进技术能够带来非凡进步的关键领域……

    Google AI· 当日· 单源未证实

04行业动态1 条

05技巧与观点1 条

  • Gemini Live 音频

    工具:Gemini Live 音频。Google 今天发布了 Gemini 3.8 Live 和 3.8 Live Extended Thinking——两款与 OpenAI 的 GPT-Live 系列形态类似的语音到语音新模型。我让 GPT-6 Astra Extra High 阅读文档,为我构建了这个 Web UI。

    Simon Willison· 当日· 单源未证实

R榜单速览数据快照

榜单页当天的快照,编号为榜内名次。只列名称与指标,不给出条目链接 —— 榜单行的 URL 是榜单页本身。

  1. claude-fable-5(Arena 文本总榜第 1 名)综合1 · 专家1 · 难题2 · 代码1 · 数学1 · 创作1 · 指令2 · 长查询2
  2. claude-opus-4-6-high(Arena 文本总榜第 2 名)综合2 · 专家2 · 难题1 · 代码3 · 数学6 · 创作2 · 指令1 · 长查询1

Artificial Analysis

榜单页 ↗
  1. Claude Fable 5.1 (max with fallback)智能指数 53 · 每任务 $7.63 · 输出 66 tok/s · 首字延迟 234.98s · 上下文 1M · 厂商 Anthropic
  2. GPT-6 Astra (max)智能指数 53 · 每任务 $3.26 · 输出 54 tok/s · 首字延迟 308.27s · 上下文 1M · 厂商 OpenAI

OpenRouter

榜单页 ↗
  1. GPT-5.6 Luna(OpenRouter 调用量第 1 名)17.4T tokens,占比 21%
  2. Hy4 预览版(OpenRouter 调用量第 2 名)13.6T tokens,占比 27%

另有 134 条因篇幅控制未展示 —— 这部分是低分长尾,没有进日报正文。