Anthropic 发布新一代 Mythos 级模型 Claude Fable 5,该模型在软件工程、科学研究和视觉任务中达到 SOTA 水平,且定价大幅降低。据 Anthropic 官方博文,Fable 5 在处理长且复杂的任务时领先优势最明显,其输入 token 定价为 10 美元/百万,输出为 50 美元/百万,不足 Claude Mythos Preview 的一半。
据 Pankaj Kumar 披露,Anthropic 内部正在测试代号为 Mythos 5 的新模型,该模型在 SVG 生成、前端开发及代码优化领域表现极强,但其高昂的推理成本或将导致公开版本被削弱。
谷歌与 SpaceX 达成算力租赁协议,每月支付 9.2 亿美元 以租用约 11 万块 NVIDIA GPU 及相关组件,旨在应对 Gemini Enterprise 对 agent 平台激增的需求。
OpenAI 计划对 ChatGPT 进行自发布以来最大规模的架构重组,将其从单纯的聊天机器人转型为集成编程工具与 AI agents 的“超级应用”(superapp)。据 Financial Times 报道,此次调整旨在通过提升高利润产品的占比来驱动收入增长,为该公司今年计划的 IPO 铺路。
Anthropic 发布深度分析报告,披露 AI 正在加速自身的开发进程,并探讨递归自我改进(Recursive Self-Improvement)的潜在路径与风险。据 Anthropic 研究博客,该公司工程师每季度的代码提交量已达到 2021-2025 年平均水平的 8 倍,且绝大部分代码由 Claude 自动编写。
Anthropic 或将发布新版本 Mythos 模型,其内部红队测试代号为 Oceanus,定价预计为 16 美元/百万 input tokens 及 80 美元/百万 output tokens。据 leo (@synthwavedd) 披露,该模型版本性能优于此前的 Mythos Preview。
谷歌发布 Gemma 4 系列模型的量化感知训练(QAT)版本,旨在显著降低端侧设备的内存需求并优化在手机与笔记本电脑上的运行效率。据 Google 官方博文,此次更新通过在训练过程中模拟量化,最大程度减少了模型压缩后的质量损失,其中 Gemma 4 E2B 模型的内存占用已降低至 1 GB 以下。
谷歌发布 Gemma 4 12B 模型,采用无需编码器的统一架构,旨在将多模态智能与 agent 能力直接带到个人笔记本电脑。据 Google 官方博文,该模型在保持轻量化显存占用的同时,推理能力接近 26B MoE 模型,并首次为中型模型引入原生音频输入。
微软发布 MAI-Code-1-Flash 编程模型,旨在为开发者提供更快速、高效的日常工作流辅助。据 微软官方博文,该模型已开始向 Visual Studio Code 中的 GitHub Copilot 个人用户推送,用户可通过模型选择器或自动选择功能调用。
微软发布名为 MAI-Thinking-1 的中型推理模型,旨在通过自研的 Hill-Climbing Machine 训练管线实现能力的持续迭代。据 Microsoft AI 官方博文,该模型在软件工程 benchmark 上可与顶级模型匹敌,且在盲测中比 Claude Sonnet 4.6 更受用户青睐。
OpenAI 发布研究报告,披露 Codex 正从纯编程工具演变为通用生产力工具,其周活跃用户数已突破 500 万。据 OpenAI 官方博文,自 2 月份发布桌面应用以来,Codex 的用户规模增长了 6 倍以上,其中非开发者的知识工作者群体增长速度是开发者的 3 倍。
Anthropic 宣布扩大 Project Glasswing 项目规模,将 Claude Mythos Preview 的漏洞扫描能力开放给更多关键基础设施供应商。据 Anthropic 官方博文,该项目首批 50 家合作伙伴已利用该模型发现了超过 10,000 个高危或严重级别的安全漏洞。