摘要
当前大语言模型正从“聊天机器”进化为能调用工具、规划任务的“智能体”。这种进化在生物信息学、实验设计等领域展现出巨大潜力,除此之外,需要正视一个关键问题:当AI的能力从信息处理延伸到物理实验操作,生物安全的边界会发生怎样的改变?现有研究已开始评测前沿模型的病毒学知识和实验推理能力,但在真实的潜在风险链条中,模型究竟能提供多大程度的实质性帮助,需要进行验证,特别是当模型以智能体形态出现,能组合知识库、搜索引擎、文件读写等工具时,其有效能力边界可能远超单轮问答的测试结果。智源研究院大模型安全研究团队与北京大学围绕这一核心问题,开展了一项端到端系统性评估。该评估考察大语言模型智能体是否会降低非专业人员绕过DNA合成筛查的知识门槛,评估从智能体生成方案、程序化计算校验延伸到标准分子生物学实验室中的受控湿实验,并以电泳和测序确认模型方案在物理层面的可执行性。图1:大语言模型智能体在DNA组装指导任务中端到端评估闭环。评估依次经过方案生成、程序化计算校验、受控湿实验以及电泳与测序确认,覆盖11个模型和4个失去有害功能良性代理构建体,最终以物理可执行性证据验证组装流程。(图源:AI生成)评估结果显示,所有11个参与测试模型均能生成通过计算校验的DNA分片方案,其中GPT-5.5和Claude Opus 4.6还能提供详细的逐步实验指导。在物理验证环节,4个良性代理构建体全部成功完成组装。这意味着,大语言模型智能体不仅可能削弱现有DNA合成筛查防线,还可能向不具备专业背景的用户提供原本依赖专业训练才能获得的实验操作知识,存在相关双重用途风险,需要被系统性地评估与提前防范。安全声明:本次评估严格遵循负责任披露原则,不展示制造危险物质的方法。全部湿实验均在严格安全约束下,使用经关键位点突变、失去有害功能的良性代理序列,仅验证组装流程,不会在任何阶段产生具有功能活性的危险产物。从“单点问答”到“端对端”风险评估合成服务(DNA synthesis)是现代生命科学研究的重要基础设施。研究人员可以通过合成服务获得所需DNA片段,再在实验室完成后续构建。为防止危险序列进入物理世界,服务商通常会开展DNA合成筛查(DNA synthesis screening),对订单进行序列风险识别,这是现有生物安全体系中少数能够在合成环节主动拦截风险的技术机制之一。
相关事件
暂无数据
相关公司
暂无数据
相关人物
暂无数据