9 月 22 日
共收录 15 条(头条 4 + 精选 11) · 7 个信源
数据来自 AI HOT / Arena / Artificial Analysis / Latent Space / OpenAI Blog / SemiAnalysis / Simon Willison
01今日重点4 条
小米发布 MiMo-V2.6 Pro 与 Flash 全模态开源模型
小米 MiMo 发布 MiMo-V2.6 Pro 与 Flash 两个全模态模型,通过规模化强化学习训练。Pro 在多数 Agent 基准上与 Claude Opus 5 和 GPT-5.6 Sol 表现相当,在 Artificial Analysis Intelligence Index 得分 46,为开源模型中最高;能力覆盖编码、computer use、3D 推理和创作。
AI HOT· 当日· 单源未证实· 社交平台原帖(未经官方渠道核实)
Artificial Analysis 评测 Grok 4.7:智能体知识工作跻身前沿,编码代理得分升至 56
Artificial Analysis 发布 Grok 4.7 评测,该模型在 Intelligence Index 得 46 分,较 Grok 4.6 高 2 分,AA-Briefcase 得 1657 Elo(+111),仅次于 Claude Opus 5 和 Claude Fable 5.1。
AI HOT· 当日· 单源未证实
Jev 推出全新形态的 LLM——System One,又名决策模型
上周 TypeSafe AI 发布了 Jev,这是他们所称的「System One 模型」这一全新模型类别的首个实例(我同意 Maggie Appleton 的看法,我认为「决策模型」是对这类模型更好的命名)。Jev 是标准 LLM 形式的一个有趣变体:它仍然接受文本输入,但返回的不是文本,而是浮点数
Simon Willison· 当日· 单源未证实
Jev:用于生产而非充当全知者的 System One 模型——对话 TypeSafe AI CEO Diogo Almeida
AIE NYC 门票现已开售,并可申请仅限邀请的 AIE CODE。欢迎加入我们!我们与今天的嘉宾关系不同寻常:自合著 InstructGPT 论文以来的多年里,Diogo Almeida 一直表示可通过 API 访问的前沿模型已经……
Latent Space· 当日· 单源未证实
02模型发布/更新3 条
小米 MiMo-V2.6-Pro 登上 Code Arena: WebDev 榜约第10名,开源权重中约第3
小米发布 MiMo-V2.6-Pro 与 Flash 两款全模态模型,MiMo-V2.6-Pro 在 Code Arena: WebDev 榜以 1628 分(AutoEval)位列约第10名,开源权重(MIT 许可)中约第3,较 MiMo-V2.5-Pro 的 1475 分上涨 153 分。
AI HOT· 当日· 单源未证实· 社交平台原帖(未经官方渠道核实)
小米发布开放权重模型 MiMo-V2.6-Pro,登顶 Artificial Analysis 开放权重模型智能指数
小米(Xiaomi)发布开放权重模型 MiMo-V2.6-Pro,在 Artificial Analysis Intelligence Index 得分 46,超越前代 MiMo-V2.5-Pro 的 26,为开放权重模型中最高。
AI HOT· 当日· 单源未证实· 社交平台原帖(未经官方渠道核实)
Higgsfield AI 借助 GPT-6 Astra 一天内上线全新视频功能
借助 GPT-6 Astra,Higgsfield AI 让小型企业的视频广告创作更加简单,并加速新创意工具的上市。
OpenAI Blog· 昨日· 单源未证实
03行业动态1 条
04技巧与观点1 条
Cloudflare Python Workers 正式发布
Cloudflare Python Workers 正式发布。经过两年的预览期,Cloudflare 在其服务端 Workers 平台上运行 Python 代码的支持现已稳定:「Python 现已成为 Cloudflare 开发者平台上一等公民、完全支持的语言」。其中有个巧妙的实现方式:Cloudflare 在其基于 V8 的 workerd 运行时中,通过 Pyodide 运行编译为 WebAssembly 的 Python
Simon Willison· 当日· 单源未证实
R榜单速览数据快照
榜单页当天的快照,编号为榜内名次。只列名称与指标,不给出条目链接 —— 榜单行的 URL 是榜单页本身。
Artificial Analysis
榜单页 ↗- MiMo-V2.6-Pro智能指数 46 · 每任务 $0.13 · 输出 130 tok/s · 首字延迟 2.17s · 上下文 1M · 厂商 Xiaomi
- GPT-6 Astra (low)智能指数 46 · 每任务 $0.82 · 输出 55 tok/s · 首字延迟 2.46s · 上下文 1M · 厂商 OpenAI
- Qwen3.8 Max (0902)智能指数 45 · 每任务 $5.41 · 输出 39 tok/s · 首字延迟 2.94s · 上下文 984k · 厂商 Alibaba
Arena
榜单页 ↗- claude-opus-5-max(Arena 文本总榜第 14 名)综合14 · 专家13 · 难题14 · 代码18 · 数学3 · 创作13 · 指令7 · 长查询15
- gemini-3.1-pro-preview(Arena 文本总榜第 15 名)综合15 · 专家22 · 难题16 · 代码28 · 数学22 · 创作9 · 指令16 · 长查询13
- gemini-3-pro(Arena 文本总榜第 16 名)综合16 · 专家33 · 难题22 · 代码34 · 数学30 · 创作7 · 指令25 · 长查询24
另有 63 条因篇幅控制未展示 —— 这部分是低分长尾,没有进日报正文。