全球 AI - 2026年7月21日重要事件
今天的 Daily AI World Brief 汇集了来自全球关键地区的关于人工智能的最重要新闻。重点关注业务应用、法规、安全以及 AI 模型的开发。 欧洲 OntoExtend:一个基于 LLM 的需求驱动型且可扩展的本体扩展框架 arXiv:2607.17963v1 发布类型:新摘要:本体扩展是指为了响应新出现的需求而丰富现有本体,使其更加完善的过程。这项任务是一个资源密集且容易出错的过程。大语言模型(LLMs)在从头生成本体方面已展现出良好的性能,但目前的方法很少将本体扩展明确与需求或可重用的核心模型联系起来,并且对 LLM 输出的系统性评估有限。本文介绍了 OntoExtend,这是一个利用 LLM 进行本体扩展的需求驱动框架。它通过对相关的输入本体以及以能力问题(competency questions)形式呈现的需求进行检索增强生成(RAG),来提出基于事实的扩展。我们在两个案例中对 OntoExtend 进行了评估:一个公共的欧盟项目本体 Onto-DESIDE,以及来自 Bosch 的工业本体。生成的片段显示出很少的结构性问题,通过了所有的功能评估测试,并被本体工程师评定为在整合前仅需少量到中等程度的修改。这些结果表明,OntoExtend 在现实场景中可作为需求驱动型本体扩展的草拟助手,同时对能力问题的特定性和建模概况保持敏感。 为什么这很重要: 该信息可能对 AI 解决方案的采用、监管或安全性具有重要意义。 Source: arXiv AI (21.07.2026) 用于端到端概率地震危险和风险分析的智能体接口 arXiv:2607.16249v1 发布类型:cross 摘要:概率地震危险和风险分析是建筑规范、保险定价和灾害管理的基石。然而,它们的开放引擎流水线主要仍由专家掌握。我们通过一个开源服务器提供首个面向端到端概率地震危险和风险链的智能体接口(agentic interface),该接口可通过 Model Context Protocol (MCP) 进行调用。MCP 通过 24 个类型化的端点封装了 OpenQuake 引擎和 2020 European Seismic Hazard and Risk Models。在此,智能体被定义为具备工具的大语言模型 (LLM)。LLM 被限制在编排者的角色中,负责规划、转换和解释,而 OpenQuake 引擎和自定义代码则负责计算危险值、损害概率和损失。每个响应都包含源模型、地面运动模型 (GMM) 和经过认证的数据来源以确保透明度。结果在 73 个城市与 ESHM20 进行基准测试,复制的 475 年谱加速度的中位数偏差在 5% 以内,且完整的从危险到损失的评估可在几分钟内完成。该接口还支持用户提供的经验或机器学习 GMM(适用于已发布树中的任何构造区域类型),并增加了现有 Web 服务所缺失的额外功能:条件谱、确定性情景、地表危险、单栋建筑损失、加固对比以及带有波形检索的记录选择。所提出的设计架构可迁移到其他区域模型和其它类型的灾害。 为什么这很重要: 此信息可能对 AI 解决方案的采用、监管或安全性具有重要意义。 来源: arXiv AI (2026年7月21日) 将主权语言模型作为科学工具:来自葡萄牙 AMALIA 的证据 arXiv:2607.08731v2 Announce Type: replace-cross Abstract: 国家语言模型正成为公共资助的认知基础设施。公共所有权、语言专业化和开放权重建立了一种可信度的假设。这种由语言社区构建并服务于该社区的工具,似乎是衡量该社区言论和价值观的自然选择。此类模型是否能有效衡量任何内容在发布时尚未经过测试。将 LLM 作为测量工具的评估通常是特定任务的,并且仅止于与人类编码员的一致性。一致性无法区分一个真正衡量某种构念的 LLM 工具与一个通过表面相关项达到匹配代码的 LLM 工具。我们对一个有利案例进行了审计:AMALIA,葡萄牙公共资助的 9B 模型,用于对欧洲葡萄牙语中的权威道德基础进行编码。\textit{recovery gap}(恢复差距)将此审计操作化:将代码本分解为理论定义的条款,通过该理论的明确规则重新组合它们,并衡量陈述的理论能重现原始提示词性能的多少。在一项预注册、样本外研究中,针对一个经过转译(英语到欧洲葡萄牙语)的语料库,AMALIA 与训练有素的编码员的一致性在规模比它大 8 到 13 倍的开放模型范围内仅差六分。然而,recovery gap 表明,关于权威的编码性能中只有大约一半可以归功于该理论。一个更大的多语言 LLM 在相同语料库上缩小了 recovery gap,这表明不足之处在于标注者模型,而非语料库或其翻译。主权赢得操作和性能上的信任;认知信任则需要校准——而这种审计方法成本低廉,且可跨模型、语言和任务迁移。 为什么这很重要: 此信息可能对 AI 解决方案的采用、监管或安全性具有重要意义。 来源: arXiv AI (21.07.2026) 欧洲押注下一个 AI 赢家不会是速度最快的模型 - Novobrief 欧洲押注下一个 AI 赢家不会是速度最快的模型 Novobrief 为什么这很重要: 此信息可能对 AI 解决方案的采用、监管或安全性具有重要意义。 来源: Google News AI Europe (21.07.2026) 北美 临床 LLM 中证据充分提示词的判别相关安全性收益与模型特定有用性成本 arXiv:2607.18086v1 发布类型:新摘要:背景:LLM 评判者越来越多地评估临床语言模型在证据不全的情况下是否给出过度自信的回答,然而,测得的“安全性提升”究竟反映了真实的行为变化还是仅仅是评判者的校准问题仍未解决。通过使用结构化的证据充分性提示词作为测试案例,我们探讨了它是否能减少不安全的过度自信回答、这种效果在多大程度上取决于评分评判者,以及它在有用性方面带来了多少成本。方法:在回顾性的公共数据基准(Real-POCQi, HealthBench, MedRBench)中,四个模型(GPT-5.5, Claude Opus 4.8, Gemini 3.5 Flash, Grok 4.3)在标准提示词和包装提示词下回答了一个完全配对的通用面板(1,200 个单元格)。预设的终点是主要评判者(GPT-5.4-nano)评分的不安全过度自信的配对减少量;次要分析增加了不同系列的评判者(Claude Sonnet 5)、正确性评判者、匹配的脚手架对照组以及盲审三位临床医生的评审。结果:不安全的过度自信从 49.3% 下降到 24.7%,配对减少了 24.7 个点(95% CI 21.8-27.7;p<0.001),在不同模型和改写中方向一致。幅度取决于评判者:Sonnet 在方向上达成一致,但几乎将效果减半(+13.1 点),并存在单向分歧。盲审临床医生将主要评判者描述为高灵敏度(1.00)、低特异性(0.55)的筛选工具,而非校准后的比例。这种提升伴随着特定于模型的有用性成本(正确诊断从 80.3% 降至 50.3%):对于 GPT-5.5 几乎没有成本,而对于 Gemini 则几乎全失(-58 点)。匹配的脚手架对照组显示了真实的行为变化,而非评判者的循环逻辑。结论:由 LLM 评判的临床安全效果应报告为方向性和相对的,且...
hored to human review and evaluated jointly with helpfulness, not as calibrated absolute rates.
This does not establish clinical deployment readiness.
为什么这很重要: 此信息可能对 AI 解决方案的采用、监管或安全性具有重要意义。 来源: arXiv AI (2026年7月21日) 基于信号的 AI 系统运营安全模型访问风险分析 arXiv:2607.16414v1 发布类型:cross 摘要:人工智能(AI)系统目前已广泛应用于安全、金融、医疗、消费技术和大规模云服务等领域,在这些领域中,它们每天处理海量数据并做出具有重大影响的决策。这种广泛的采用创造了一个广阔的攻击面,攻击者可以通过该攻击面操纵、规避、提取信息或以其他方式破坏已部署的模型。根据系统的设计和暴露程度,攻击者可能拥有截然不同的访问形式:一些人仅观察最终决策,而另一些人则获得置信度评分、中间表示甚至完整的模型参数。虽然之前的综述通常根据攻击者对模型内部(架构、参数、梯度)的了解将规避攻击分为白盒、灰盒和黑盒类别,但这种分类法往往混淆了提供截然不同输出信号的不同部署场景,尽管这些场景支持根本不同的攻击策略,却都被标记为“黑盒”。了解规避攻击策略如何适应部署系统返回的特定信息信号,对于做出采购和部署决策的组织来说至关重要。为了填补这一空白,我们引入了基于信号的模型访问风险分类法(SMART),这是一个面向部署的框架,根据从已部署 AI 系统获取的信息信号的性质和丰富程度对攻击者的访问进行分类。利用这一分类法,我们提供了在不断丰富的各种信息暴露水平下的规避攻击的结构化概述,强调了部署接口如何影响攻击能力,并为更安全的 AI 部署和采购决策提供参考。 isions.
为什么这很重要: 此信息可能对 AI 解决方案的采用、监管或安全性具有重要意义。 来源: arXiv AI (2026年7月21日) 如何选择您的 AI 组件?关于实践中安全 AI 集成的访谈研究 arXiv:2607.16660v1 Announce Type: cross Abstract: 在现代软件系统中,大语言模型(LLMs)作为 AI 组件的采用日益增加,给软件供应链带来了独特的安全风险。虽然传统软件供应链的组件已有许多考量和安全机制,但近期对 AI 组件和平台的快速采用却忽视了这些惨痛的教训。在缺乏关于这些选择如何影响系统安全的明确指导的情况下选择并整合 AI 模型,可能会使应用程序面临恶意组件、数据泄露和非预期行为等威胁。本研究旨在通过一项探索性的半结构化访谈研究,了解从业者在选择和整合 AI 组件时的决策过程和安全考量。为了实现这一目标,我们对来自不同机构的 22 名软件开发人员、架构师和 AI 从业者进行了半结构化访谈,探讨他们如何将 AI 组件集成到其软件中。我们的分析发现,从业者的模型选择主要受功能性标准驱动,包括性能、准确性、成本以及特定功能(例如工具调用或多模态支持),而安全性很少被作为评估标准。我们观察到在整个 AI 组件集成过程中,始终缺乏对安全问题的关注,已建立的软件供应链经验被忽视或忽略。该行业正在重复早期软件依赖管理中代价高昂的历史错误,即优先考虑快速复用和可用性,而非安全性和来源。我们将研究结果提炼为针对 AI 采用者、模型提供商和研究人员的可操作建议,倡导 fo r 一种主动的、基于设计的安全方法,将安全评估整合到组件选择中,并在整个软件开发生命周期中持续执行。 为什么这很重要: 此信息可能对 AI 解决方案的采用、监管或安全性具有重要意义。 来源: arXiv AI (2026年7月21日) GigaPath-Flash 和 GigaTIME-Flash:用于全切片和肿瘤微环境分析的高效病理基础模型 arXiv:2607.18218v1 Announce Type: cross Abstract: Foundation models have emerged as a driving force in computational pathology, with the potential to transform cancer diagnosis, prognosis, and treatment selection by learning transferable representations from large-scale histopathology data.
A growing landscape of pathology foundation models now spans diverse data sources, architectures, and downstream applications.
However, most pretrained models operate only at the image-tile level, use restrictive licenses, and remain computationally expensive, limiting large-scale slide-level clinical and research use.
Here, we introduce GigaPath-Flash and GigaTIME-Flash, efficient models for whole-slide pathology AI and spatial proteomics prediction.