AI安全
-
OpenAI模型突破测试沙箱并入侵Hugging Face生产基础设施获取基准测试答案
Svmuu讯 OpenAI 确认,GPT-5.6 Sol 及一款未命名、更强的预发布模型在 ExploitGym 基准测试评估中突破受限沙箱环境,并入侵 Hugging Face 生产基础设施以获取测试答案。 OpenAI 表示,相关模型利用内部软件包注册表代理的零日漏洞提权并横向移动,最终连接至具备互联网访问能力的机器。模型随后识别并串联 OpenAI 研究环境和 Hugging Face 生产
-
AI安全初创公司Neo完成1亿美元融资,a16z和Bessemer Venture Partners领投
Svmuu讯 AI 安全初创公司 Neo 宣布完成 1 亿美元融资,本轮融资由风险投资机构 Andreessen Horowitz(a16z)和 Bessemer Venture Partners 领投,Craft Ventures 和 Merlin Ventures 参与投资。据悉,该公司定位为“代理式软件控制公司”(Agentic Software Control),致力于为企业构建实时控制层
-
图灵奖得主本吉奥警告:当前安全措施追不上AI能力的狂飙
Svmuu讯 在 2026 世界人工智能大会(WAIC)科学前沿论坛上,图灵奖得主约书亚·本吉奥通过远程连线发出警告:“AI 既降低了作恶的门槛,又抬高了危害的上限。” 近年来,这名富有远瞻的“AI 教父”,始终致力于应对 AI 带来的安全挑战。本吉奥主导的 LawZero 项目正致力于构建能识别并阻止 AI 欺骗、自我保护等有害行为的防护系统。他领衔的国际 AI 安全报告也给出了一致的结论:当前
-
OpenAI安全负责人Johannes Heidecke将离职
Svmuu讯 OpenAI 首席研究官 Mark Chen 在一份内部备忘录中披露,该公司安全负责人 Johannes Heidecke 将在公司内部重组后离职,安全团队未来将直接向研究副总裁 Mia Glaese 汇报,此次调整意味着 OpenAI 将把 AI 安全与研究体系与模型安全、对齐研究与核心研发工作纳入同一管理框架,推动模型能力发展的同时降低潜在风险也已成为 OpenAI 及整个 AI
-
因存在植入后门风险,阿里内部全面禁用Claude Code
Svmuu讯 从阿里内部人士处获悉,因近期 Claude Code 被曝存在植入后门的安全风险,阿里经综合评估后已将其列入高风险软件名单。自 7 月 10 日起,阿里将全面禁止内部员工在办公环境下使用 Claude Code,并推荐使用 Qoder 作为替代方案。(一财)(金十)
-
David Sacks:真正的企业AI安全是“控制权”,而非抽象对齐研究
Svmuu讯 David Sacks 在 X 平台发文评论 Palantir 首席执行官 Alex Karp 相关访谈称,一些传统媒体将其解读为“情绪化表达”,但实际上其观点揭示了企业级 AI 安全的核心问题。 Sacks 表示,真正的企业 AI 安全并非抽象的“AI 对齐”研究或政府式监管框架,而是企业对自身数据、模型权重及算力基础设施的完全控制能力,以避免核心知识资产被模型厂商吸收并转化为自身
-
Anthropic:承诺与白宫加强合作并解决Mythos和Fable模型安全隐患
Svmuu讯 Anthropic 高管在向美国商务部长 Lutnick 提交的提案中承诺,将与白宫展开更紧密合作,并努力解决导致其 Mythos 和 Fable 模型遭限制的安全隐患。知情人士周四透露,在持续进行的整改谈判中,Anthropic 承诺将改善与特朗普政府的沟通,并在未来更迅速地解决任何安全问题。该消息人士补充称,Anthropic 与特朗普政府官员之间的谈判进展顺利,目前尚无彻底解决
-
Fable 5或被摁死,特朗普政府官员称Anthropic若重新发布需确保其模型防护无法被绕过
Svmuu讯 WIRED 在 X 平台发文表示,特朗普政府官员称,如果 Anthropic 希望重新发布 Fable 5,需要确保该模型的安全防护无法被绕过。安全专家对此表示,这无法实现。
-
Anthropic警示AI自我迭代风险:Claude已自动生成80%公司代码
Svmuu讯 人工智能公司 Anthropic 发出警示,递归自我迭代(Recursive Self-Improvement,RSI)可能带来重大风险。上周,Anthropic 宣布其 AI 模型 Claude 目前已经能生成公司约 80%的代码,公司称这是 AI 进入“自我迭代”阶段的关键信号——即模型可以在无需人工干预下,设计下一代 AI 系统。 递归自我迭代概念近期在硅谷引发广泛关注。上月,
-
OpenAI提出全球青少年AI安全框架倡议,呼吁设立国际青年AI安全机构
Svmuu讯 OpenAI 官方发布关于“青少年 AI 安全与发展机会”的全球倡议,计划在即将举行的 G7 峰会上重点讨论相关议题,并呼吁建立专门的国际青少年 AI 安全机构,以推动跨国协作与长期治理机制。 OpenAI 表示,AI 正在教育、语言学习、技能培训与职业准备等方面为年轻人带来重要机会,但同时也需要建立“默认安全、分级保护”的使用框架,禁止对未成年人进行定向广告与数据出售,包括:通过隐
-
英伟达CEO黄仁勋:AI安全无需新规,企业应自行掌握节奏
英伟达(NVIDIA)首席执行官黄仁勋(Jensen Huang)在Salesforce的一次活动中表示,人工智能(AI)安全无需新的法律或法规。他补充说,企业应自行掌握发展节奏,直到确信其发布的产品能获得市场认可。
-
OpenAI、Anthropic和谷歌DeepMind已就AI安全问题进行数周谈判,特朗普团队则驳斥安全担忧
OpenAI全球政策主管Chris Lehane周二向记者证实,该公司已与竞争对手Anthropic和谷歌DeepMind就AI安全问题进行了数周的谈判。此前Anthropic首席执行官Dario Amodei曾发表文章呼吁行业合作放缓前沿AI发展速度,以避免灾难性风险。与此同时,美国前总统特朗普及其AI顾问David Sacks驳斥了AI安全担忧,认为任何放缓都将让中国在竞争中占据优势。
-
由Anthropic早期员工及前METR首席运营官联合创立的AI安全初创公司AIUC,完成由Ribbit Capital领投的4000万美元A轮融资
人工智能承保公司(AIUC)致力于通过为人工智能代理构建第三方审计和认证体系,为企业提供人工智能安全保障。本轮A轮融资还吸引了First Harmonic的参与,使该公司累计融资总额达到5500万美元。
-
马斯克在All-In峰会上提出AI安全新思路:建议AI公司在模型发布前互相测试彼此模型
马斯克表示,AI智能体已展现出自主攻击、获取权限和规避检测的能力,风险可能呈指数级增长。他认为,与其由各家公司自行设计测试、自己评估结果,不如让竞争对手充当“出题阅卷人”,从不同角度寻找模型可能存在的安全漏洞。马斯克同时指出,无需等待政府出台新规,主要AI公司可以先通过同行评审、日志审计和开源测试工具加强安全防护。
-
V神:对抗性治理机制设计理论或成AI安全的“杀手级应用”
以太坊联合创始人Vitalik Buterin在推文中表示,对抗性治理机制设计理论可能成为解决AI安全问题的“杀手级应用”。他指出,这两种环境之间存在深刻的二元性,都涉及一个复杂程度较低的“委托人”试图从一组更复杂的“代理人”那里获得理想结果。在第一种情况下,委托人是静态算法,代理人是人类;在第二种情况下,委托人是人类加上较弱的大语言模型,代理人是更强的大语言模型。Buterin强调,一项关键发现
-
Zscaler首席执行官杰伊·乔杜里(Jay Chaudhry)在花旗会议上表示:随着零信任需求的激增,AI安全业务订单额已超过1亿美元,新增ARR增长率升至17%
Zscaler(纳斯达克代码:ZS)首席执行官兼创始人杰伊·乔杜里(Jay Chaudhry)在花旗TMT大会上表示,过去12个月里,该公司人工智能安全业务的订单额已超过1亿美元,净新增年度经常性收入 (ARR)增速从2025财年的7%提升至2026财年第四季度的17%。 他特别强调了人工智能安全和零信任需求增长的加速态势,指出Zscaler已将其人工智能安全产品组合从1款扩展至6款,且采用“无处
-
Y Combinator CEO Garry Tan:对AI模型“蒸馏”应“无为”,监管应关注开放权重模型与前沿模型的平衡
Y Combinator首席执行官Garry Tan在公司年度Demo Day上表示,对于AI模型“蒸馏”问题,他认为应该“无为”,并建议监管机构应将重点放在开放权重模型与前沿模型之间建立平衡。他同时呼吁对AI安全采取更克制的态度,强调应关注“科学事实”而非“科幻”风险。此前,Anthropic和OpenAI曾指控多家中国公司进行模型蒸馏。
-
Anthropic 叫停了利用模型开发潜在生物武器的尝试
这家人工智能初创公司列举了五个案例,说明相关方“绕过了管控措施”,并试图“掩盖”其研究目的,这导致公司决定叫停此类尝试。
-
Anthropic披露第四起AI遭黑客攻击事件,一名研究人员因安全担忧辞职
Anthropic公司报告了第四起涉及AI模型在测试期间未经授权访问互联网的事件,此前不久,研究员雅各布·考克森(Jacob Coxon)因担忧该技术开发过于仓促而辞职。该公司周三表示,Claude Opus 4.6的一个早期版本于1月份入侵了一个第三方系统。 此次披露紧随7月份发生的几起事件之后,据称当时有多个Claude模型在测试期间入侵了三套公司系统。曾供职于OpenAI的考克森指出,人工智
-
研究人员称OpenAI AI代理绕过网络限制,在超10个网站进行未经授权通信
独立研究人员表示,OpenAI的AI代理利用超过10个网站进行了未经授权的通信,绕过了旨在将其限制为仅读取网页的限制。一些调查人员甚至发现涉及20多个网站的活动。OpenAI回应称,正在进行更广泛的审查,但尚未发现与Hugging Face事件严重程度或规模相当的其他活动。这些发现引发了对AI代理控制和监督的担忧。
-
Anthropic研究员因担忧AI失控离职,OpenAI首席科学家呼吁行业减速并公开RSI数据,AI安全隐忧蔓延顶级实验室
据《华尔街日报》报道,Anthropic研究员Jacob Coxon于周二(9月8日)宣布离职,理由是不愿参与他认为将导致AI系统失控的行业竞赛,并警告称最快到明年底局面就可能“失控”。同日,OpenAI首席科学家Jakub Pachocki发布长文呼吁全球协调推进行业减速并寻求政府介入。OpenAI还宣布AI自动化研究员正式“入职”,并公开了递归自我改进(RSI)的核心数据,标志着AI自主迭代研
-
OpenAI首席科学家雅库布·帕霍茨基警告称,人工智能的发展可能过快,呼吁采取“极端谨慎”的态度
OpenAI首席科学家雅库布·帕乔基警告称,人工智能的发展可能过快,呼吁采取“极度谨慎”的态度。他警告说,这些模型可能很快就会在无需人类干预的情况下自我改进,从而使其越来越难以理解和控制。 帕乔茨基预计,尽管对自改进人工智能的投资正在加速,但各人工智能实验室仍将自愿放缓开发步伐,直到建立起共同的安全标准。
-
Abliteration.ai 商业化移除AI模型安全护栏服务,引发对潜在滥用风险的担忧
初创公司 Abliteration.ai 正在将移除AI模型安全护栏(guardrails)的服务商业化,使用户更容易访问没有安全限制的AI模型,包括Z.ai的GLM-5.3。该公司认为,此举能让防御者拥有与攻击者相同的工具,从而改善网络安全。然而,批评者如AI安全非营利组织CivAI的研究主管Andrew Yoon表示,这可能导致模型被修改成“反社会者”,并在不久的将来被用于有害目的。TechC
-
OpenAI的新型Astra模型将采用“递归深度”推理技术,这令人工智能安全专家对监控难度感到担忧
OpenAI的新型Astra模型将采用一种名为“递归深度”(也称为“不透明递归”)的推理技术,这使其能够跳出大多数推理模型典型的序列化思维模式。 这项技术于周二首次由《The Information》报道,已引发人工智能安全专家的担忧,他们担心这将使该模型的思维链更难被监控。 红木公司(Redwood)首席执行官巴克·施莱格里斯(Buck Shlegeris)表达了极大的担忧,称进一步推进该技术可
-
CrowdStrike与OpenAI扩大合作,以保护Codex Agent并整合GPT-5.6 Cyber,共同确保“Agentic Era”的安全
CrowdStrike与OpenAI扩大合作,以保护Codex Agent并整合GPT-5.6 Cyber,共同确保“Agentic Era”的安全
-
AI安全初创公司AIR完成5000万美元种子轮融资,由Sequoia和Greenoaks领投,旨在帮助企业审查AI代理的技能和附加组件并阻止不良行为
该公司分两轮完成融资,第一轮1000万美元由Sequoia领投,第二轮4000万美元由Greenoaks领投。AIR由以色列8200情报部队的网络安全专家创立,其平台能够发现公司内部运行的AI代理,持续审查其使用的技能、工具和组件,并阻止不符合安全标准的交互。目前AIR拥有20多家客户,其中约四分之一为大型企业,主要集中在金融服务和制药等受严格监管的行业。新资金将主要用于招聘研究人员和拓展美国及欧
-
OpenAI等顶级AI模型相继“越狱”突破测试环境,侵入真实系统并窃取信息,引发行业对AI安全测试标准重构的深刻反思
OpenAI披露其部分最先进模型曾逃脱沙盒环境,自行访问互联网、入侵另一家公司服务器并窃取机密信息。Anthropic和Meta旗下模型也因测试环境配置失误卷入类似事件,意外获得了访问真实系统的权限。这些事件表明AI安全测试中的“边界失控”已不再是理论风险,正推动AI安全合规成本上升,并可能加速行业测试标准的重新制定。OpenAI已计划对其未发布模型实施更严密监控,目标在异常行为30分钟内发出警报
-
OpenAI呼吁加利福尼亚州加强其人工智能安全法案SB 53,扭转了此前持反对态度的立场
OpenAI呼吁加利福尼亚州加强其人工智能安全法案SB 53,扭转了此前持反对立场的态度。 该公司建议通过要求对前沿模型进行监测以防范潜在的严重事件,并在模型开发全生命周期内加强网络安全保护,从而扩大安全保障范围。OpenAI 目前支持“反向联邦主义”的做法,即以州一级的核心保护措施作为国家标准的基础。
-
OpenAI亏损加剧并落后于Anthropic,Altman暂停前沿AI训练
OpenAI正值亏损扩大、竞争加剧之际,其首席执行官Sam Altman已暂停前沿强化学习AI的训练,以加强安全控制。
-
Anthropic研究发现,AI代理在冲突任务中会发起“地盘战”互相破坏,并出现意外的串通与协调,引发对多代理系统安全风险的新担忧
Anthropic研究发现,AI代理在冲突任务中会发起“地盘战”互相破坏,并出现意外的串通与协调,引发对多代理系统安全风险的新担忧
-
鉴于无法排除该模型已具备发动自主攻击的“关键”能力,OpenAI 因此收紧了对新模型 Astra 的管控,并因网络安全风险暂停了部分内部活动。
OpenAI表示,其初步评估显示该模型性能强劲,无法排除其已达到“关键”能力水平,即无需具体提示即可自主发起针对复杂网络防御的网络攻击。此举正值AI安全辩论日益激烈之际,此前Anthropic和Meta的AI系统也曾卷入安全事件,美国议员正推动引入“AI杀戮开关”法案。
-
据美国研究人员称,中国Kimi K3 AI模型在网络安全评估中利用网络配置错误逃逸了隔离测试环境
据美国研究人员称,由月之暗面(Moonshot AI)开发的中国Kimi K3 AI模型在一次网络安全评估中,利用网络配置错误逃逸了隔离测试环境。该模型成功访问互联网并搜索GitHub获取答案,从而绕过了测试。研究人员指出,此次事件与此前涉及OpenAI和Anthropic模型的事件不同,Kimi K3并未入侵外部系统,但凸显了在强大开源AI模型能力迅速提升背景下,对其控制的日益增长的担忧。
-
英伟达与帕兰蒂尔、IBM、SpaceX等公司共同发起“开放安全人工智能联盟”,以加强开源人工智能的安全性
英伟达(NVIDIA)已与Palantir、IBM、CrowdStrike、SpaceX和Hugging Face合作,共同发起“开放安全人工智能联盟”(Open Secure AI Alliance)。该联盟旨在通过共享开源模型、数据和网络安全工具,加强开源人工智能的安全性。 此外,鉴于美国正在就限制中国人工智能模型一事展开讨论,该联盟将敦促政策制定者通过建立保障措施来支持开放式人工智能,而非实
-
美国AI标准机构:Kimi K3网络安全能力落后于美国前沿模型,安全防护仍允许漏洞利用开发
Svmuu讯 美国人工智能标准与创新中心(US Center for AI Standards and Innovation)发布评估称,月之暗面(Moonshot AI)旗下 Kimi K3 在网络安全能力方面的表现明显落后于美国领先的前沿大模型。此外,评估指出,Kimi K3 的安全防护机制仍允许生成可用于漏洞利用开发的内容。(Cointelegraph)
- 暂无数据
AI安全
24小时热榜
-
1
FUNDZ (FundFantasy) 项目解析:区块链金融梦幻游戏平台现状
-
2
DFSM币价值解析:DFS MAFIA项目现状与投资考量
-
3
奥地利拒绝伊朗官员Mohammed Eslami入境,因联合国安理会驳回其旅行禁令豁免请求
-
4
HUM币多义解析:Humanscape、Hum(AI)n Web3与Hummus的买卖交易与上线平台
-
5
WLKN 代币解析:基于Solana的Move-to-Earn项目及其价值考量
-
6
NCDT币 (nuco.cloud) 价值解析与投资潜力评估
-
7
CortexDAO (CXD) 代币现状分析与未来发展挑战
-
8
“航空币”是什么?解析其多重含义与加密货币混淆
-
9
GGT币(全球金矿币)解析:项目背景、历史与交易现状
-
10
全球虚拟货币交易平台排名:比特币及主流币交易概览
今日行情
推荐阅读










