LLM大模型邮报
  • 首页
  • 模型动态
  • 研究前沿
  • 教程指南
  • 行业观察
  • 关于

首页

  • Gemini 3.5 Flash 跑分出炉:Agentic 能力逼近 GPT-5.4

    • 模型动态
    • •
    • 2026 年 5 月 20 日 02:09
    • •
    • ···

    据 artificialanalysis 评测报告 披露,Google 推出新一代 Flash 系列模型 Gemini 3.5 Flash,在 Intelligence Index 综合评测中斩获 55 分。该模型在复杂规划与幻觉抑制维度表现突出,支持图像、视频与语音多模态输入,上下文窗口维持 1M tokens。但该模型定价输入端为 1.50 美元、输出端 9.00 美元,实际运行基准测试的绝对成本较上代飙升 5.5 倍。

    MISTY
  • Google 发布 Gemini 3.5 Flash:面向智能体工作流与代码生成的前沿推理模型

    • 模型动态
    • •
    • 2026 年 5 月 20 日 01:54
    • •
    • ···

    Google 于 5 月 19 日发布 Gemini 3.5 Flash,定位前沿大模型与智能体工作流的双引擎。据 Google AI 官方博客 披露,该模型在编码与长周期智能体任务上表现突出,输出速度约为其他前沿模型的 4 倍,并作为个人 AI 智能体 Gemini Spark 的默认底层架构。

    MISTY
  • Google 发布 Antigravity 2.0 桌面应用 多 Agent 编排构建操作系统

    • 模型动态
    • •
    • 2026 年 5 月 20 日 01:45
    • •
    • ···

    Google 在 2026 年 I/O 开发者大会上正式发布 Antigravity 2.0 独立桌面应用。该架构全面转向 Agent-first 原生设计, 核心聚焦多智能体对话编排与自动化制品生成。官方披露的实证测试显示, 93 个并行子 Agent 耗时 12 小时, 仅消耗不到 1000 美元 API 额度即可完成全套操作系统的底层构建, 标志着多智能体工程化迈入新阶段。

    MISTY
  • Google 发布 Gemini 3.5 Flash:主打 agent 与 coding,定价低于竞品

    • 模型动态
    • •
    • 2026 年 5 月 20 日 01:31
    • •
    • ···

    Google DeepMind 于 2026 年 5 月 20 日发布 Gemini 3.5 系列模型家族,首款产品 Gemini 3.5 Flash 定位 agent 与 coding 场景,在多项任务上超越 Gemini 3.1 Pro,定价策略对标低价档位。据 Google DeepMind 官方推文,该模型已同步上线 Gemini App、Google Search AI Mode 及开发者平台。

    MISTY
  • Andrej Karpathy 加入 Anthropic,曾主导 Tesla Autopilot 视觉系统

    • 模型动态
    • •
    • 2026 年 5 月 19 日 23:45
    • •
    • ···

    据 Andrej Karpathy 在 X 平台宣布,其已正式加入 Anthropic,重返大语言模型前沿研发一线。这位 OpenAI 创始成员、前 Tesla AI 总监在帖文中表示,未来数年对 LLM 发展至关重要,期待在新团队中投入研究与开发工作。同时,他强调对 AI 教育的热情不减,计划在适当时机重启相关项目。

    MISTY
  • Cloudflare 测试 Anthropic Mythos Preview 红队测试: 漏洞链式利用

    • 模型动态
    • •
    • 2026 年 5 月 19 日 23:11
    • •
    • ···

    据 Cloudflare 官方博客披露,该公司近期在 Project Glasswing 内部项目中对 Anthropic Mythos Preview 完成深度安全红队测试。该模型可将散落在积压任务中的低危漏洞自动链式转换为真实利用链,并独立编写、编译和运行 PoC 实现闭环验证。本次 Mythos Preview 红队测试不仅验证了模型在攻击面测绘中的突破能力,也为安全团队的架构演进提供了关键数据。

    MISTY
  • Claude Managed Agents 发布自托管沙箱与 MCP 隧道功能

    • 模型动态
    • •
    • 2026 年 5 月 19 日 16:31
    • •
    • ···

    Anthropic 于 2026 年 5 月 19 日宣布,Claude Managed Agents 正式支持 self-hosted sandboxes(自托管沙箱)与 MCP tunnels(MCP 隧道)两项企业级功能。据Anthropic 官方公告,self-hosted sandboxes 已进入 public beta,MCP tunnels 则处于 research preview 阶段,企业管理员可在 Claude Console 的 workspace settings 中申请访问。

    MISTY
  • 让 Codex 形成持续运转的工作循环:4 个核心实践

    • 工程实践
    • •
    • 2026 年 5 月 19 日 13:02
    • •
    • ···

    OpenAI Codex 团队的 Developer Experience Engineer Jason Liu 5 月 17 日在 X 上分享了一篇个人博客 Codex-maxxing,复盘他自己怎么把 Codex 从“写代码的 agent”用成“工作能持续运转的地方”。

    MISTY
  • claude-smart 插件:CC/Codex 自我学习插件,把纠正变成下次会遵守的规则

    • 工程实践
    • •
    • 2026 年 5 月 19 日 11:06
    • •
    • ···

    用过一段时间 Claude Code 的开发者大概都遇到过同一种烦躁——这个项目用的是 pnpm 不是 npm,上周已经说过;npm test 在这个仓库里默认是 watch 模式会卡住 CI,要加 --run,上周也说过。每开一个新 session,这些纠正都要重来一遍。claude-smart 是 Reflexio 团队推出的 Claude Code 与 Codex 双 host 插件,目标是把这些纠正变成下一次会真的被遵守的规则。它通过 lifecycle hooks 自动捕获每轮对话、工具调用和助手回复,提炼成结构化规则,并在每个新 session 启动时注入回 Claude Code 或 Codex 的系统提示。

    MISTY
  • Claude Code Fast mode 默认启用 Opus 4.7,响应速度提升 2.5 倍

    • 模型动态
    • •
    • 2026 年 5 月 19 日 05:18
    • •
    • ···

    Claude Code Fast mode 现已将默认模型从 Opus 4.6 升级至 Opus 4.7,在保持输出质量不变的前提下,响应速度提升至约 2.5 倍。据 Anthropic 官方推文及文档说明,该模式采用不同的 API 配置以优先降低延迟,输入/输出定价统一为 30 美元/百万 token,适用于快速迭代与实时调试等延迟敏感场景。

    MISTY
  • Manus 发布 Scheduled Tasks 2.0:定时任务进入上下文感知时代

    • 模型动态
    • •
    • 2026 年 5 月 19 日 05:00
    • •
    • ···

    据 Manus 官方博客介绍,Scheduled Tasks 2.0 已完成全量推送。该版本将定时任务从"按时触发"升级为"按上下文运行",支持在同一会话中延续历史记录、为 Web 应用配置后台操作,并提供独立的调度视图与运行历史追踪。所有用户现已可在任务、Project 或自建 Web 应用中直接启用。

    MISTY
  • Cursor 发布 Composer 2.5:定向 RL 文本反馈与 Sharded Muon 优化器详解

    • 模型动态
    • •
    • 2026 年 5 月 19 日 04:40
    • •
    • ···

    据 Cursor 官方博客,Composer 2.5 已正式向 Cursor 用户开放。该版本基于 Moonshot 的 Kimi K2.5 开源检查点持续预训练,在长任务持续执行、复杂指令遵循与协作体验上均有显著提升。输入定价 $0.50/百万 tokens,输出定价 $2.50/百万 tokens;快速版本定价 $3.00/$15.00,首周提供双倍用量额度。

    MISTY
  • 第 10 / 21 页
    较新文章
  • 第 10 / 21 页
    较早文章

网站

  • WordPress

社交媒体

  • X(Twitter)
  • 小红书 Xiaohongshu

友情链接

  • WinDiscover

© 2026 LLM大模型邮报 · 保留所有权利