AI复利手记

9 月 22 日

共收录 15 条(头条 4 + 精选 11) · 7 个信源

数据来自 AI HOT / Arena / Artificial Analysis / Latent Space / OpenAI Blog / SemiAnalysis / Simon Willison

15
收录条目
4
头条
0
多源共振
63
未展示(低分)

01今日重点4 条

  1. 小米发布 MiMo-V2.6 Pro 与 Flash 全模态开源模型

    小米 MiMo 发布 MiMo-V2.6 Pro 与 Flash 两个全模态模型,通过规模化强化学习训练。Pro 在多数 Agent 基准上与 Claude Opus 5 和 GPT-5.6 Sol 表现相当,在 Artificial Analysis Intelligence Index 得分 46,为开源模型中最高;能力覆盖编码、computer use、3D 推理和创作。

    AI HOT· 当日· 单源未证实· 社交平台原帖(未经官方渠道核实)

  2. Artificial Analysis 评测 Grok 4.7:智能体知识工作跻身前沿,编码代理得分升至 56

    Artificial Analysis 发布 Grok 4.7 评测,该模型在 Intelligence Index 得 46 分,较 Grok 4.6 高 2 分,AA-Briefcase 得 1657 Elo(+111),仅次于 Claude Opus 5 和 Claude Fable 5.1。

    AI HOT· 当日· 单源未证实

  3. Jev 推出全新形态的 LLM——System One,又名决策模型

    上周 TypeSafe AI 发布了 Jev,这是他们所称的「System One 模型」这一全新模型类别的首个实例(我同意 Maggie Appleton 的看法,我认为「决策模型」是对这类模型更好的命名)。Jev 是标准 LLM 形式的一个有趣变体:它仍然接受文本输入,但返回的不是文本,而是浮点数

    Simon Willison· 当日· 单源未证实

  4. Jev:用于生产而非充当全知者的 System One 模型——对话 TypeSafe AI CEO Diogo Almeida

    AIE NYC 门票现已开售,并可申请仅限邀请的 AIE CODE。欢迎加入我们!我们与今天的嘉宾关系不同寻常:自合著 InstructGPT 论文以来的多年里,Diogo Almeida 一直表示可通过 API 访问的前沿模型已经……

    Latent Space· 当日· 单源未证实

02模型发布/更新3 条

03行业动态1 条

04技巧与观点1 条

  • Cloudflare Python Workers 正式发布

    Cloudflare Python Workers 正式发布。经过两年的预览期,Cloudflare 在其服务端 Workers 平台上运行 Python 代码的支持现已稳定:「Python 现已成为 Cloudflare 开发者平台上一等公民、完全支持的语言」。其中有个巧妙的实现方式:Cloudflare 在其基于 V8 的 workerd 运行时中,通过 Pyodide 运行编译为 WebAssembly 的 Python

    Simon Willison· 当日· 单源未证实

R榜单速览数据快照

榜单页当天的快照,编号为榜内名次。只列名称与指标,不给出条目链接 —— 榜单行的 URL 是榜单页本身。

Artificial Analysis

榜单页 ↗
  1. MiMo-V2.6-Pro智能指数 46 · 每任务 $0.13 · 输出 130 tok/s · 首字延迟 2.17s · 上下文 1M · 厂商 Xiaomi
  2. GPT-6 Astra (low)智能指数 46 · 每任务 $0.82 · 输出 55 tok/s · 首字延迟 2.46s · 上下文 1M · 厂商 OpenAI
  3. Qwen3.8 Max (0902)智能指数 45 · 每任务 $5.41 · 输出 39 tok/s · 首字延迟 2.94s · 上下文 984k · 厂商 Alibaba
  1. claude-opus-5-max(Arena 文本总榜第 14 名)综合14 · 专家13 · 难题14 · 代码18 · 数学3 · 创作13 · 指令7 · 长查询15
  2. gemini-3.1-pro-preview(Arena 文本总榜第 15 名)综合15 · 专家22 · 难题16 · 代码28 · 数学22 · 创作9 · 指令16 · 长查询13
  3. gemini-3-pro(Arena 文本总榜第 16 名)综合16 · 专家33 · 难题22 · 代码34 · 数学30 · 创作7 · 指令25 · 长查询24

另有 63 条因篇幅控制未展示 —— 这部分是低分长尾,没有进日报正文。