全球 AI - 2026年7月24日重要事件

今天的 Daily AI World Brief 汇集了来自全球关键地区的关于人工智能的最重要新闻。重点关注业务应用、法规、安全以及 AI 模型的开发。 欧洲 SafeStep:为患有衰弱或痴呆症的老年人提供 AI 驱动的旅行辅助服务 arXiv:2607.21156v1 发布类型:新摘要:英国有超过一百万人患有衰弱或痴呆症,这严重损害了他们在城市环境中旅行的能力。本文介绍了 SafeStep,这是一个由人工智能驱动的出行系统,旨在辅助老年用户完成旅程。SafeStep 的核心是一种新型的路径图表示法,它将路线规划与预测建模相结合。对于旅程的每个阶段,该系统 (i) 利用 LLM 与 Anticip8 行为预测引擎的组合生成个性化的失败场景,(ii) 提出针对性的干预措施,并 (iii) 评估这些干预措施对结果概率的影响。这使得 SafeStep 能够选择出最大化提高人员到达目的地的概率的干预措施。SafeStep 通过关于路径图生成的实验以及一项涉及 26 条真实旅程的实地研究进行了评估。结果表明,将用于失败预测的 Anticip8 与用于干预评估的基于 GPT 的模型相结合,可以获得最可靠的性能。用户反馈表明,SafeStep 提高了旅行过程中的信心和感知的安全性,尽管针对目标人群的界面可用性仍需改进。在未来,我们希望改进并发布 SafeStep。为 SafeStep 开发的 AI 系统还可以应用于其他领域,如心理健康、职业指导和成瘾治疗。 为什么这很重要: 该信息可能对 AI 解决方案的采用、监管或安全性具有重要意义。 来源: arXiv AI (24.07.2026) 监管自主和代理式 AI arXiv:2607.21345v1 发布类型:新摘要:监管受监管者使用自主和代理式 AI 的活动具有挑战性。关于受监管者知识和控制权的监管假设不再成立;其中大部分内容位于 AI 供应链的其他环节,因此需要纳入监管范围。针对自主 AI 的治理体系无法复制现有的治理模型,而是需要全新的方法。回顾性的监督监管作为风险管理工具变得低效,且 AI 的自主性产生了新的系统性风险,需要新的解决方案。本文研究了四种监管体系:英国对内容平台的监管、数据保护、英国金融服务以及欧盟《人工智能法案》的跨行业制度。它分析了自主和代理式 AI 带来的挑战,并提出了监管机构可能采用的潜在解决方案。这些方案将把监管从反应式过程转变为主动过程,并帮助其适应 AI 自主性带来的挑战。 为什么这很重要: 该信息可能对 AI 解决方案的采用、监管或安全性具有重要意义。 来源: arXiv AI (24.07.2026) 一个用于德语和英语的自主、开源基础模型 arXiv:2607.09424v3 Announce Type: replace-cross Abstract: 我们推出了 Soofi S 30B-A3B,这是一个面向德语和英语的自主、开源的混合 Mamba Transformer MoE(混合专家)基础模型。其混合设计在每个 token 处理时仅激活 30B 参数中的 3B,并在上下文增加时保持推理缓存近乎恒定,这使其在长上下文、高并发部署方面比稠密模型具有决定性的吞吐量优势。Soofi S 在包含大量德语权重的约 27 万亿 token 上进行了预训练,在综合的英语和德语基准测试中,Soofi S 与稠密的 14 到 27B 模型相当,同时在 17 个开放基础模型中取得了两种语言最佳的代码综合得分,并且在我们的对比中超越了所有欧洲自主基准模型(包括那些活跃参数远大于它的模型)。在全开源模型中,Soofi S 获得了最高的英语和德语评估分数,领先于 Olmo 3 32B 和 Apertus 70B。Soofi S 是在德国工业 AI 云上端到端构建的,这是由 Deutsche Telekom 在慕尼黑运营的自主 HPC 规模 AI 基础设施。Soofi S 将在高度宽松、开放获取的条款下发布:包括权重、选定的中间检查点、完整的每源数据核算、超参数以及训练和评估代码。在源许可允许的情况下,数据构建产物将以宽松许可证发布;商业许可的来源将提供汇总统计数据和准确的混合比例记录。 Why this matters: 此信息可能对 AI 解决方案的采用、监管或安全性具有重要意义。 Source: arXiv AI (24.07.2026) SAP 将收购德国 AI 初创公司 Prior Labs,斥资 10 亿欧元押注于企业数据 AI - ascendants.in SAP 将收购德国 AI 初创公司 Prior Labs,斥资 10 亿欧元押注于企业数据 AI ascendants.in 重要性: 此信息可能对 AI 解决方案的采用、监管或安全性具有重要意义。 来源: Google News AI Europe (23.07.2026) 北美 Euclid-MCP:一个通过 Prolog 实现确定性逻辑推理的模型上下文协议服务器 arXiv:2607.21412v1 发布类型:新摘要:大语言模型(LLMs)在自然语言理解和生成方面表现出色,但在多步骤逻辑推理方面仍不够可靠,尤其是在安全关键或合规敏感领域。近期的神经符号方法通过将神经网络模型与外部符号引擎耦合来填补这一空白,但大多数集成都是定制化的,且缺乏用于工具增强型智能体的标准化接口。本文提出了 Euclid-MCP,这是一个提供通过 SWI-Prolog 进行确定性逻辑推理的开源 MCP 服务器。Euclid-MCP 引入了 Euclid-IR,这是一种与引擎无关的 Horn 子句逻辑中间表示,它具有良好的可读性、易于被 LLM 生成,并且可以轻松编译到 Prolog 或其他后端。该服务器提供了一个紧凑的工具接口,支持“翻译-运行-检查-修复”循环,使 LLM 客户端能够在委托推理的同时保留对证明轨迹和推导日志的完全访问权限。我们在一个真实的 IT 安全和合规使用案例中评估了 Euclid-MCP。结果表明,虽然在小型知识库上仅依靠 LLM 就足够了,但在面对较大问题时,它们会产生系统性的幻觉;相比之下,Euclid-MCP 能以更低的延迟和更简洁的输出提供准确答案。我们认为语义 RAG 从根本上不适用于规则执行,而 Euclid-MCP 可以作为基于 RAG 的助手和智能体系统的稳定、共享推理基底。 重要性: 此信息可能对 AI 解决方案的采用、监管或安全性具有重要意义。 来源: arXiv AI (24.07.2026) 通过具备决策意识的机器学习改善基本药物的可及性 arXiv:2607.20542v1 发布类型:cross 摘要:中低收入国家(LMICs)医疗体系中的一个关键挑战是稀缺资源(尤其是基本药物)的高效且公平的分配。由于高质量数据有限,限制了传统数据驱动技术的适用性。我们提出了一种用于基本药物分配的新型决策感知机器学习框架,该框架额外利用多任务学习来确保样本效率,并利用催化先验来确保公平分配。通过与塞拉利昂政府合作,我们将系统作为决策支持工具在全国范围内进行了分阶段部署。我们的计量经济学评估发现,在受试地区,分配产品的消耗量估计增加了 19%,证明了其在提高基本药物可及性方面的有效性。随后,我们的工具在全国范围内扩大规模,覆盖了约 200 万名妇女和五岁以下的儿童。我们的工作展示了机器学习方法如何在资源受限的全球健康环境中以极低的成本提高效率。 为什么这很重要: 该信息可能对 AI 解决方案的采用、监管或安全性具有重要意义。 来源: arXiv AI (24.07.2026) StabilityBench:基准测试大语言模型(LLMs)中的不稳定性 arXiv:2607.20558v1 Announce Type: cross Abstract: AI Assistants are increasingly deployed in high-stakes settings, such as healthcare or government services.

Yet their real-world behavior remains poorly understood due to strong context dependence.

Current evaluation protocols follow a defense-in-depth paradigm with compounding layers of safeguards, ranging from traditional benchmarks to live or adversarial testing.

Such benchmarks remain largely static and single-turn, limiting their ability to capture real-world variability in conversational settings.

We propose StabilityBench, a principled, general and model-agnostic benchmark operator that transforms single-turn benchmark queries into multi-turn interaction histories.

StabilityBench augments existing benchmarks by injecting realistic user simulations, through demographic proxies or sycophantic baits, while preserving original task intent.

We apply StabilityBench to four benchmarks spanning mathematical reasoning, health question-answering and safety, and evaluate nine large language models under these conditions.

Our results show that model performance is consistently unstable under these injections, with considerable performance degradations on three out of four benchmarks studied.