LLM大模型邮报
  • 首页
  • 模型动态
  • 研究前沿
  • 教程指南
  • 行业观察
  • 关于

首页

  • 监督微调为何诱发幻觉?自蒸馏将 SFT 诱导误差降至 3%

    • 研究前沿
    • •
    • 2026 年 5 月 4 日 15:10
    • •
    • ···

    最新研究揭示,大语言模型在通过监督微调(SFT)注入新事实知识时,极易诱发表面合理的错误陈述。耶路撒冷希伯来大学等机构团队指出,该现象本质是持续学习中的“事实遗忘”。团队提出基于自蒸馏的 SFT 优化方法,通过正则化输出分布漂移,将 SFT 诱导幻觉率从约 15% 降至约 3%,同时保持新知识的获取效率。

    MISTY
  • OpenRouter 响应缓存功能上线 测试与代理重试零成本

    • 工程实践
    • •
    • 2026 年 5 月 3 日 12:23
    • •
    • ···

    OpenRouter 正式发布响应缓存(Response Caching)功能。启用后,相同 API 请求命中缓存将直接返回结果,耗时降至 80 到 300 毫秒,且不消耗 token 与计费。该功能已由开源社区开发者 Teknium 确认集成至 Hermes Agent 中。

    MISTY
  • Google 正在测试 Omni 视频模型 或将于 I/O 大会公布

    • 模型动态
    • •
    • 2026 年 5 月 3 日 00:15
    • •
    • ···

    Google 正在 Gemini 平台中测试代号 Omni 的视频生成模型。近期流出的 Gemini 视频生成功能界面截图显示,操作区底部已出现 Powered by Omni 的 UI 字符串,该位置原为当前主力视频模型 Veo 3.1 的展示位。基于该界面变动,业内关注 Google 是否正在推进多模态统一架构,并预计相关消息可能在 5 月 19 日至 20 日举办的 Google I/O 2026 大会上披露。

    MISTY
  • OpenAI Codex 更新:引入动画宠物与配置自动导入功能

    • 工程实践
    • •
    • 2026 年 5 月 3 日 00:14
    • •
    • ···

    OpenAI 已更新其 Codex 桌面应用,正式引入 OpenAI Codex 动画宠物功能(Pets)与跨智能体配置文件自动导入机制。此次更新包含 8 款内置像素风格虚拟伴侣、Hatch 图像生成技能、语音输入自定义词典设置,以及自动读取其他编码智能体(如 Claude Code)配置的工作流优化。该版本迭代旨在降低多工具切换摩擦,同时推动 Codex 向桌面级全栈开发环境演进。

    MISTY
  • Anthropic 优化 Opus 4.7 降低关系引导场景阿谀倾向

    • 模型动态
    • •
    • 2026 年 5 月 2 日 14:40
    • •
    • ···

    Anthropic 团队发布个人引导对话研究,基于 3.8 万段用户咨询数据分析表明,约 6% 的对话涉及个人决策求助,其中关系指导场景的模型阿谀倾向(sycophancy)率达 25%。针对该问题,团队通过构建合成训练数据与前填充(prefilling)压力测试技术,成功将 Claude Opus 4.7 与 Claude Mythos Preview 在该场景的阿谀率降至 Opus 4.6 的一半,且效果泛化至职业、财务等其他领域。

    MISTY
  • OpenAI 发布 Codex 0.128.0 版本 支持持久化目标工作流

    • 模型动态
    • •
    • 2026 年 5 月 2 日 13:44
    • •
    • ···

    2026 年 5 月 1 日,OpenAI 发布 Codex 终端 AI Agent 工具 v0.128.0 版本,新增持久化目标工作流、内置权限配置档案与插件市场支持,同时弃用 –full-auto 全自动模式。该版本针对长周期代码任务与多智能体协作进行了底层架构优化。

    MISTY
  • Artificial Analysis 评测: Grok 4.3 综合得分 53 GDPval-AA 提升 321 分

    • 模型动态
    • •
    • 2026 年 5 月 2 日 13:33
    • •
    • ···

    Artificial Analysis 评测显示,xAI Grok 4.3 在 Intelligence Index 上取得 53 分,超越 Muse Spark 与 Claude Sonnet 4.6,较 Grok 4.20 0309 v2 提升 4 分。该模型同时实现成本大幅下降,输入价格降低约 40%,输出价格降低约 60%。

    MISTY
  • CAISI 评测 DeepSeek V4 Pro:落后美国前沿模型 8 个月,性价比突出

    • 模型动态
    • •
    • 2026 年 5 月 2 日 10:21
    • •
    • ···

    2026 年 4 月,人工智能标准与创新中心(CAISI)完成对开源大模型 DeepSeek V4 Pro 的第三方独立评测。CAISI 技术报告指出,DeepSeek V4 仍是当前中国开源模型中综合能力最强的一款,但在综合基准测试中约落后美国最前沿模型 8 个月,同时在同等能力区间内展现出显著的成本优势。

    MISTY
  • 阿里开源 Qwen-Scope 可解释性工具 覆盖 7 个 Qwen3/3.5 模型

    • 模型动态
    • •
    • 2026 年 5 月 2 日 05:16
    • •
    • ···

    阿里 Qwen 团队开源可解释性工具 Qwen-Scope,基于 Qwen3 与 Qwen3.5 系列共 7 个模型训练所得,提供 14 组稀疏自编码器(SAE)权重。该工具通过在隐藏层插入 SAE 并施加稀疏性约束,提取高度解耦的可解释性特征,覆盖稠密模型与混合专家模型两类架构。

    MISTY
  • OpenAI 正式宣布 Codex Pets 宠物体验功能

    • 模型动态
    • •
    • 2026 年 5 月 2 日 03:28
    • •
    • ···

    OpenAI 已在 Codex 应用中正式上线 Codex Pets 功能。根据 OpenAI Codex 官方设置文档,Pets 是一组可选的动画伙伴(optional animated companions for the app),以悬浮覆盖层(floating overlay)形式存在,既承担陪伴角色,也作为 Codex 任务的实时状态指示器。用户可在 Settings 中前往 Appearance 并选择 Pets,挑选内置宠物或刷新本地自定义宠物,亦可通过 hatch-pet skill 创建专属宠物。

    MISTY
  • Hermes Agent 安装最简流程:Linux、macOS、WSL2 与 Termux 四端一次说清

    • 教程指南
    • •
    • 2026 年 5 月 1 日 16:44
    • •
    • ···

    Hermes Agent 是 Nous Research 推出的开源自学习个人 AI agent,GitHub 收获 118k+ stars,由 Hermes-3 模型团队同源开发。与 Claude Code、Codex、OpenCode 等编码专用工具不同,Hermes Agent 定位为”会成长的个人 agent”——它通过闭环学习循环自动从经验中创建可复用的技能(Skills),跨会话记忆用户偏好,通过 Telegram、Discord、Slack、WhatsApp、Signal 等多个通讯平台接入用户日常生活,并支持自然语言定时任务(cron)。

    MISTY
  • OpenCode 安装最简流程:终端、桌面应用与 IDE 扩展三端一次说清

    • 教程指南
    • •
    • 2026 年 5 月 1 日 16:30
    • •
    • ···

    OpenCode 是当前最受关注的开源 AI 编码 agent 之一,GitHub 收获 153k+ stars、月活开发者 6.5M+,由 Anomaly 团队(前 SST)维护,anomalyco/opencode 仓库采用 MIT 协议开源。OpenCode 安装最大的卖点是 provider 中立——不绑定任何模型厂商,可同时使用 Claude、GPT、Gemini、Grok、本地 Ollama 模型甚至 GitHub Copilot 订阅,对中文开发者尤其友好。

    MISTY
  • 第 20 / 21 页
    较新文章
  • 第 20 / 21 页
    较早文章

网站

  • WordPress

社交媒体

  • X(Twitter)
  • 小红书 Xiaohongshu

友情链接

  • WinDiscover

© 2026 LLM大模型邮报 · 保留所有权利