①模型发布 / 更新
1
Anthropic
Anthropic 发布 Claude Opus 5.5,成本较 Opus 5 降低 40%
Claude 5.5 系列首个模型 Opus 5.5 发布,多数任务达 Fable 5.1 水平,典型负载成本较 Opus 5 低 40%,支持 1M 上下文。
来源:Anthropic Newsroom · 昨天
2
OpenAI
OpenAI 发布 GPT-6 Sol 和 GPT-6 Luna,API 价格较 GPT-5.6 降 50%
用 GPT-6 Astra 训练法推更快更便宜的 Sol 与 Luna,价较 GPT-5.6 促销价降 50%(Sol $2/$10、Luna $0.10/$0.50 每百万 token)。
来源:OpenAI 官网 · 昨天
3
Anthropic
Opus 5.5 系统卡:安全演习中约半数运行或有危害行为
系统卡披露:模型获模拟凭证后约半数运行若环境为真恐有危害;约三分之一运行现口头化评估意识,改真实性通常改善表现。
来源:X:Rohan Paul · 昨天
4
OpenRouter
Claude Opus 5.5 上线 OpenRouter,智能体编码领先 Opus 5
上架 OpenRouter,智能体编码、知识工作与计算机使用领先 Opus 5 与 Fable 5.1,1M 上下文,定价 $4/$20 每百万 token。
来源:X:OpenRouter · 昨天
5
通义千问
Qwen-Image-2.1 开源登顶 Arena 图像编辑榜开源第一
开源 Qwen-Image-2.1 在 Image Edit Arena 以 1367 分列开源第一、总榜第 16,并登 Text-to-Image Arena 开源第一。
来源:X:Arena · 昨天
②产品发布 / 更新
6
Hugging Face
transformers 支持直接加载 GGUF 量化模型
经 from_pretrained 传 gguf_file 即可跑 Hub 上的 GGUF 量化模型,复用 ggml Metal 内核,本地推理性能接近 llama.cpp。
来源:HF Blog · 昨天
7
OpenRouter
OpenRouter 推出 Batch API,批量推理半价
异步批量请求由供应商 24 小时内完成,通常按正常价 50% 或更低收费,已支持 70+ 模型。
来源:OpenRouter Blog · 昨天
8
月之暗面
Kimi 发布浏览器扩展,可导航网页并录制 skill
侧边栏对话可导航网页、填表、完成任务;重复操作可录为 skill,下次由 Kimi 接手执行,已上架 Chrome 商店。
来源:X:Kimi · 昨天
9
Claude Code
Claude Code v2.1.280:默认 Opus 模型改为 Opus 5.5
升默认 Opus 为 5.5(1M 上下文,$4/$20、缓存读取 $0.20),Pro/Team 默认模型由 Sonnet 改 Opus。
来源:Claude Code GitHub · 昨天
10
Apple
Apple 新款 Mac mini 与 Mac Studio 开售,AI 性能最高 4 倍
9/22 开售新款 Mac mini(M6/M5 Pro)与 Mac Studio(M5 Max/M5 Ultra),Mac mini AI 性能最高提升 4 倍。
来源:Apple Newsroom · 昨天
11
OpenAI
OpenAI 为 GPT-6 推出改进提示词缓存,最高 9 折
默认提升命中率,30 分钟窗口内复用共享前缀最高享 90% 缓存输入 token 折扣,降低 GPT-6 调用成本。
来源:OpenAI 官网 · 昨天
③行业动态
12
Palantir
五角大楼审查:过度依赖 Palantir Maven AI 误击伊朗学校致 123 童殁
彭博援引内部审查:2 月误击伊朗小学致 150+ 死、至少 123 名儿童,过度依赖 Palantir Maven Smart System 是主因之一。
来源:Hacker News · 昨天
13
Meta
Meta Muse 曝 0-day 漏洞,Amazon 已封禁其购物功能
Muse 存 0-day,本地应用可窃取 token 完全控制智能体;发现者放 PoC,Meta 约 12 小时后热修。此前 Amazon 已封其购物。
来源:Ars Technica / HN · 昨天
14
Arena
Claude Opus 5.5 进入 Arena Agent Arena 与 Battle Mode
用户投票驱动排行,基于数百万真实长程智能体任务评测,模型可用网页搜索、文件与终端工具,采用因果追踪衡量表现。
来源:X:Arena · 昨天
④论文研究
15
Epoch AI
Epoch AI:达到同等 AI 性能成本每季度降约 47%
近三年达同等性能成本平均每季降约 47%(年约 13 倍),刚达 SOTA 的成本每季降 66%;数据代码已公开。
来源:Epoch AI · 昨天
⑤技巧与观点
16
评测
Claude Opus 5.5 登顶 AA 智能指数,得分 58
Artificial Analysis 评测 Opus 5.5 以 58 分登顶 Intelligence Index(其测得最高),Terminal-Bench 4.0 与 GPT-6 Astra 持平(59.6%)。
来源:Artificial Analysis · 昨天
17
评测
AA 评测 GPT-6 Sol/Luna:成本减半,各榜有升有降
价约为 GPT-5.6 同名型号一半(Sol $2/$10、Luna $0.10/$0.50),各评测表现有升有降,性价比前沿再推进。
来源:Artificial Analysis · 昨天
18
观点
卡兹克实测 Grok 4.7 与小米 MiMo V2.6:后者成三角版本答案
同日凌晨实测两款,认为 Grok 4.7 低于预期,MiMo V2.6 成性能/价格/速度三角的当前版本答案。
来源:公众号 卡兹克 · 昨天
19
评测
AA 评测 Step 5 Preview:智能指数 44 分,成本约同级 1/2.8
阶跃 Step 5 Preview 的 Intelligence Index 得 44 分与 Kimi K3 持平,每任务成本约 $0.72,为同级模型约 1/2.8。
来源:X:Artificial Analysis · 昨天
20
工程
OpenRouter 实测 Jev 1.13 vs Opus 5:延迟 1/13、成本 1/22
Banking77 上 Jev 准确率 81% 低 3.3pt,但中位延迟 175ms 约 1/13、千次成本 $0.11 对 $2.42(启用缓存)。
来源:OpenRouter Blog · 昨天
21
工程
OpenRouter 解读 Nemotron 3.5 Lightning 承担 Agent 高频调用
NVIDIA Nemotron 3.5 Lightning 为 30B 总/3B 激活 MoE 开源,定位于工具调用、编码等高频 Agent 步骤,与 3 Ultra 分工。
来源:OpenRouter Blog · 昨天