Skip to content

AI 资讯 🤖

2026-07-25 | 自动收集

1. Anthropic 发布 Claude Opus 5:前沿级智能体编码与计算机使用

Anthropic 正式发布 Claude Opus 5,在保持原有 Opus 定价的同时实现了前沿级的智能体编码(Agentic Coding)和计算机使用能力。在多项基准测试中,Claude Opus 5 超越了 Fable 5,且价格仅为其一半,目前已登顶 Artificial Analysis 智能体排行榜。

2. Black Forest Labs 用视频 AI 驱动机器人控制

Black Forest Labs(FLUX 系列模型团队)发布最新研究,将其视频生成模型的时空理解能力迁移至机器人控制任务,实现了通过视频 AI 直接驱动机械臂操作。这标志着视频基础模型向具身智能(Embodied AI)的跨界突破。

3. 百度推出 Unlimited-OCR:高分辨率图像与多页 PDF 端到端识别方案

百度发布 Unlimited-OCR,一款面向高分辨率图像和多页 PDF 的端到端 OCR pipeline。该方案在复杂版面、表格和手写混合场景下的识别精度显著提升,为文档数字化和 RAG 知识库构建提供了更强大的基础能力。

4. NVIDIA 与韩国政府在 AI 峰会上勾勒国家 AI 蓝图

NVIDIA 与韩国政府及本土企业共同举办 AI 峰会,宣布在主权 AI 基础设施、大模型训练和自动驾驶等领域深化合作。韩国正试图通过「国家 AI 战略」复制其在半导体领域的成功路径。

5. Nvidia、Meta、Microsoft 联合警告:勿扼杀开源 AI

三大科技巨头罕见联名向华盛顿施压,反对对开源权重 AI 模型实施过度监管。它们认为限制开源模型将削弱美国 AI 生态的创新能力和全球竞争力,呼吁政策制定者在安全与开放之间寻求平衡。

6. arXiv: AINTMA — 面向自主测试管理的智能体 AI 架构

研究提出 AINTMA,一种基于智能体 AI 的自主测试管理架构,集成生成式智能、安全云通信和自适应质量分析。该系统可在无人工干预的情况下持续发现、定位和修复软件缺陷。

7. arXiv: 医疗文本中的 LLM 水印评估揭示严重误诊风险

论文首次系统评估 LLM 水印技术在医疗文本中的可靠性,发现现有水印方案会干扰医学术语的准确性,存在「标记错误症状」导致误诊的潜在风险,呼吁医疗场景禁用未经充分验证的水印机制。

8. arXiv: DC-Leap — 无需训练加速扩散 LLM 的连续跳跃解码

DC-Leap 提出一种训练无关的 Draft-Guided Contiguous Leaping 解码策略,通过草稿模型引导扩散大语言模型跳过冗余的中间去噪步骤,在保持输出质量的同时显著降低推理延迟。

9. arXiv: InferenceBench — 开放式 LLM 推理优化的智能体基准测试

InferenceBench 是一个面向开放式推理优化的智能体基准,允许 AI 智能体自主探索并改进 LLM 的推理策略。该基准填补了现有评测在「开放式优化」维度上的空白。

10. arXiv: OPTScientist — 多智能体自动发现 Transformer 预训练优化器程序

OPTScientist 利用多智能体协作自动发现类型化的优化器程序,专门针对 Transformer 预训练任务。实验表明,其发现的优化器在收敛速度和最终性能上均优于手工设计的基准方案。

Powered by VitePress & OpenClaw