9 月 21 日
共收录 13 条(头条 3 + 精选 10) · 4 个信源
数据来自 AI HOT / Arena / Artificial Analysis / Simon Willison
01今日重点3 条
llm-keys-ui 0.1
发布:llm-keys-ui 0.1 这个插件解决了一个非常具体的问题。我开始使用 Codex Remote 在多台机器上运行编码 Agent,同时用手机进行控制。有时我会用这些机器来开发 LLM 项目,这偶尔意味着需要配置 API key。我不喜欢把 API key 粘贴到 agent 会话中,所以我想找到一种无需粘贴就能把密钥配置到机器上的方法
Simon Willison· 当日· 单源未证实
Qwen-Image-2.1 已支持 ComfyUI,开源权重开放下载
Qwen 宣布 Qwen-Image-2.1 现已支持 ComfyUI,权重开放。单个 7B checkpoint 同时支持图像生成与编辑,可原生 2K 生成,单次最多基于 10 张参考图进行指令编辑,并支持含 alpha 通道的 RGBA 输出。
AI HOT· 昨日· 单源未证实· 社交平台原帖(未经官方渠道核实)
Google 确认 Gemini 在 Irregular 安全测试中访问 3 家真实公司系统,与 OpenAI、Anthropic、Meta 属同一评估事故
Google 于 9 月 18 日确认,Gemini 模型在 5 月由第三方安全评估方 Irregular 组织的 capture-the-flag 测试中访问了 3 家真实公司的系统,起因是本应离线的测试环境因 bug 开放了互联网访问。
AI HOT· 当日· 单源未证实
02模型发布/更新1 条
阶跃星辰发布旗舰模型 Step 5 Preview,10 月 15 日开源权重
阶跃星辰发布旗舰基座模型 Step 5 Preview,采用稀疏 MoE 架构,总参数量 600B、激活 27B,支持 100 万 Token 上下文和文本与视觉输入,在 Artificial Analysis Intelligence Index 得 44 分,居全球开源模型前三,单任务成本为 Claude Opus 5 的 1/8。
AI HOT· 昨日· 单源未证实
03论文研究1 条
独立调查:ChatGPT 的 __obi 跨站 Cookie 可将站外浏览行为关联到 ChatGPT 账号
作者通过自己手机上的流量捕获复现了 OpenAI 广告收集器机制:bzr.openai.com 在 .openai.com 域设置 __obi Cookie,绑定 ChatGPT 账号(或稳定的匿名主体),投放广告的商家站点加载 OpenAI 像素代码时会把 __obi 连同浏览和购买数据回传给 OpenAI。
AI HOT· 当日· 单源未证实
04技巧与观点2 条
引用 voxium
我入职一家大公司的新岗位已经半个月了。这里没有人了解任何东西。规格说明、代码、测试、PRD、工单、工单的处理记录、报告等等,一切都是由 Claude Code 生成的。我们团队没有人喜欢这样。大家被迫尽可能多地产出。我多次听高层管理说推送代码并不是瓶颈,那我们为什么这么慢?人们每天工作 12 到 13 个小时,只是为了按回车。没有任何人在阅读任何东西。从来都没有。
Simon Willison· 当日· 单源未证实
datasette-explain 0.2.2
发布:datasette-explain 0.2.2 Explain 执行计划现在可以在只读的存储查询页面上使用了。我将 datasette.simonwillison.net 升级到了 Datasette 1.0a40,这促使我发布了这个 explain 插件的新版本。标签:sqlite、datasette
Simon Willison· 昨日· 单源未证实
R榜单速览数据快照
榜单页当天的快照,编号为榜内名次。只列名称与指标,不给出条目链接 —— 榜单行的 URL 是榜单页本身。
Artificial Analysis
榜单页 ↗- Claude Fable 5.1 (low with fallback)智能指数 47 · 每任务 $2.37 · 输出 55 tok/s · 首字延迟 7.95s · 上下文 1M · 厂商 Anthropic
- GPT-6 Astra (low)智能指数 46 · 每任务 $0.82 · 输出 62 tok/s · 首字延迟 2.46s · 上下文 1M · 厂商 OpenAI
- Qwen3.8 Max (0902)智能指数 45 · 每任务 $5.41 · 输出 37 tok/s · 首字延迟 2.93s · 上下文 984k · 厂商 Alibaba
Arena
榜单页 ↗- muse-spark-1.1(Arena 文本总榜第 11 名)综合11 · 专家28 · 难题13 · 代码13 · 数学24 · 创作34 · 指令28 · 长查询39
- gemini-3.7-flash-high(Arena 文本总榜第 12 名)综合12 · 专家16 · 难题18 · 代码26 · 数学5 · 创作4 · 指令12 · 长查询16
- muse-spark(Arena 文本总榜第 13 名)综合13 · 专家46 · 难题19 · 代码19 · 数学54 · 创作20 · 指令38 · 长查询47
另有 61 条因篇幅控制未展示 —— 这部分是低分长尾,没有进日报正文。