9 月 25 日
共收录 16 条(头条 4 + 精选 12) · 8 个信源
数据来自 AI HOT / Artificial Analysis / Google DeepMind / Latent Space / OpenAI Blog / OpenRouter / Simon Willison / arXiv cs.AI
01今日重点4 条
Harvey 用 GPT-6 Astra 将法律语境转化为更出色的文书草稿
GPT-6 Astra 能够生成更具结构性、更贴合上下文的法律文书,让律师得以专注于策略层面的工作。
AI HOT / OpenAI Blog· 09-23· 2 源共振
GPT-6 Sol 与 Luna 正式发布
认识 GPT-6 Sol 和 Luna——这两款模型以不同的能力与成本平衡,将前沿智能带入日常工作。
AI HOT / OpenAI Blog· 09-23· 2 源共振
Anthropic 发布 Claude Opus 5.5,面向更长、上下文更重的编码会话优化成本
Anthropic 发布 Claude Opus 5.5,称典型按 token 计费工作负载运行成本比 Opus 5 低约 40%,其中缓存读取降价 60%、输入输出 token 降价 20%。
AI HOT· 当日· 单源未证实
commit-rewriter 0.2
发布:commit-rewriter 0.2新增对默认分支以外分支的支持。使用 uvx commit-rewriter --branch other 即可针对其他分支运行。#3标签:git
Simon Willison· 当日· 单源未证实
02模型发布/更新1 条
Gemini 3.8 Live 携 Live Avatar 正式发布
Google DeepMind· 当日· 单源未证实
03行业动态2 条
代工厂 vs 领航员:降低科学研究的成本
在 AI 时代,科学的未来会是什么样子?Anthropic 对科学有着宏大的目标,甚至正在运营一个湿实验室。与此同时,一场悄然的变革正在整个 AI × Science 领域发生。在本文中……
Latent Space· 昨日· 单源未证实
[AINews] Meta Connect 2026:Muse 眼镜、语音、视频与 Charm
扎克伯格团队势头正盛。这里有一段 Meta Connect 的精彩集锦,Stratechery 上的盛赞之词也体现出现场的热烈氛围。遗憾的是,除了一个预告之外没有 MSL 的更新消息,毕竟 Muse Spark 三周前才刚刚发布。不过,Muse 本身……
Latent Space· 昨日· 单源未证实
04论文研究2 条
StudentBench:AI 辅导与人类辅导在 GRE 学习成效上不相上下
人工智能为增强人类能力提供了前所未有的机遇,然而前沿领域的进展主要聚焦于提升模型自身能力。我们推出 StudentBench——一套 AI 教学评估体系与公开平台,通过超过 17.5 万条学生与 AI 的对话消息实现大规模数据收集,以研究大语言模型(LLM)能否带来与人类辅导相当的学习成效。借助 StudentBench,我们测量了 GRE 定量(Quantitative)部分的学习提升……
arXiv cs.AI· 昨日· 单源未证实
我该加入哪里?基于语言引导目标预测的机器人群体加入
社会导航通常假设目标已给定,重点是在遵守社会规范的前提下到达该目标;而机器人群体加入则需要根据群体的实时活动和队形来预测应加入的位置。这是一项高度语义化的任务,却是机器导盲犬、自主代步车等应用的重要能力。我们提出了基于语言的机器人群体加入任务:给定一个观测和目标群体的自然语言描述,机
arXiv cs.AI· 昨日· 单源未证实
05技巧与观点2 条
datasette 1.0a41
发布:datasette 1.0a41Alec Garcia 在此版本中为 Datasette 添加了对 OpenTelemetry 的支持。我还将 Datasette 的所有模态对话框重构为单一的 Web Component,并已编写文档供其他插件使用。标签:javascript
Simon Willison· 当日· 单源未证实
GitHub Security Lab 发布 LLM 驱动的 Fuzzing Taskflow,自动完成 C/C++ 项目模糊测试全流程
GitHub Security Lab 的 Antonio Morales 开源了基于 Taskflow Agent 的 Fuzzing Taskflow,指向 GitHub 仓库即可自动识别入口点、编写 harness、运行 AFL++、读取覆盖报告并分诊崩溃。
AI HOT· 当日· 单源未证实
R榜单速览数据快照
榜单页当天的快照,编号为榜内名次。只列名称与指标,不给出条目链接 —— 榜单行的 URL 是榜单页本身。
Artificial Analysis
榜单页 ↗- Claude Opus 5.5 (xhigh with fallback)智能指数 56 · 每任务 $3.46 · 输出 91 tok/s · 首字延迟 148.11s · 上下文 1M · 厂商 Anthropic
- Claude Fable 5.1 (xhigh with fallback)智能指数 53 · 每任务 $5.98 · 输出 60 tok/s · 首字延迟 111.26s · 上下文 1M · 厂商 Anthropic
- GPT-6 Astra (max)智能指数 53 · 每任务 $3.26 · 输出 54 tok/s · 首字延迟 361.32s · 上下文 1M · 厂商 OpenAI
OpenRouter
榜单页 ↗- Hy4 preview(OpenRouter 调用量第 3 名)12.3T tokens 6%
- GPT-5.6 Luna(OpenRouter 调用量第 4 名)8.7T tokens 45%
另有 116 条因篇幅控制未展示 —— 这部分是低分长尾,没有进日报正文。