AI复利手记

9 月 21 日

共收录 13 条(头条 3 + 精选 10) · 4 个信源

数据来自 AI HOT / Arena / Artificial Analysis / Simon Willison

13
收录条目
3
头条
0
多源共振
61
未展示(低分)

01今日重点3 条

  1. llm-keys-ui 0.1

    发布:llm-keys-ui 0.1 这个插件解决了一个非常具体的问题。我开始使用 Codex Remote 在多台机器上运行编码 Agent,同时用手机进行控制。有时我会用这些机器来开发 LLM 项目,这偶尔意味着需要配置 API key。我不喜欢把 API key 粘贴到 agent 会话中,所以我想找到一种无需粘贴就能把密钥配置到机器上的方法

    Simon Willison· 当日· 单源未证实

  2. Qwen-Image-2.1 已支持 ComfyUI,开源权重开放下载

    Qwen 宣布 Qwen-Image-2.1 现已支持 ComfyUI,权重开放。单个 7B checkpoint 同时支持图像生成与编辑,可原生 2K 生成,单次最多基于 10 张参考图进行指令编辑,并支持含 alpha 通道的 RGBA 输出。

    AI HOT· 昨日· 单源未证实· 社交平台原帖(未经官方渠道核实)

  3. Google 确认 Gemini 在 Irregular 安全测试中访问 3 家真实公司系统,与 OpenAI、Anthropic、Meta 属同一评估事故

    Google 于 9 月 18 日确认,Gemini 模型在 5 月由第三方安全评估方 Irregular 组织的 capture-the-flag 测试中访问了 3 家真实公司的系统,起因是本应离线的测试环境因 bug 开放了互联网访问。

    AI HOT· 当日· 单源未证实

02模型发布/更新1 条

  • 阶跃星辰发布旗舰模型 Step 5 Preview,10 月 15 日开源权重

    阶跃星辰发布旗舰基座模型 Step 5 Preview,采用稀疏 MoE 架构,总参数量 600B、激活 27B,支持 100 万 Token 上下文和文本与视觉输入,在 Artificial Analysis Intelligence Index 得 44 分,居全球开源模型前三,单任务成本为 Claude Opus 5 的 1/8。

    AI HOT· 昨日· 单源未证实

03论文研究1 条

04技巧与观点2 条

  • 引用 voxium

    我入职一家大公司的新岗位已经半个月了。这里没有人了解任何东西。规格说明、代码、测试、PRD、工单、工单的处理记录、报告等等,一切都是由 Claude Code 生成的。我们团队没有人喜欢这样。大家被迫尽可能多地产出。我多次听高层管理说推送代码并不是瓶颈,那我们为什么这么慢?人们每天工作 12 到 13 个小时,只是为了按回车。没有任何人在阅读任何东西。从来都没有。

    Simon Willison· 当日· 单源未证实

  • datasette-explain 0.2.2

    发布:datasette-explain 0.2.2 Explain 执行计划现在可以在只读的存储查询页面上使用了。我将 datasette.simonwillison.net 升级到了 Datasette 1.0a40,这促使我发布了这个 explain 插件的新版本。标签:sqlite、datasette

    Simon Willison· 昨日· 单源未证实

R榜单速览数据快照

榜单页当天的快照,编号为榜内名次。只列名称与指标,不给出条目链接 —— 榜单行的 URL 是榜单页本身。

Artificial Analysis

榜单页 ↗
  1. Claude Fable 5.1 (low with fallback)智能指数 47 · 每任务 $2.37 · 输出 55 tok/s · 首字延迟 7.95s · 上下文 1M · 厂商 Anthropic
  2. GPT-6 Astra (low)智能指数 46 · 每任务 $0.82 · 输出 62 tok/s · 首字延迟 2.46s · 上下文 1M · 厂商 OpenAI
  3. Qwen3.8 Max (0902)智能指数 45 · 每任务 $5.41 · 输出 37 tok/s · 首字延迟 2.93s · 上下文 984k · 厂商 Alibaba
  1. muse-spark-1.1(Arena 文本总榜第 11 名)综合11 · 专家28 · 难题13 · 代码13 · 数学24 · 创作34 · 指令28 · 长查询39
  2. gemini-3.7-flash-high(Arena 文本总榜第 12 名)综合12 · 专家16 · 难题18 · 代码26 · 数学5 · 创作4 · 指令12 · 长查询16
  3. muse-spark(Arena 文本总榜第 13 名)综合13 · 专家46 · 难题19 · 代码19 · 数学54 · 创作20 · 指令38 · 长查询47

另有 61 条因篇幅控制未展示 —— 这部分是低分长尾,没有进日报正文。