AI安全
-
OpenAI模型突破測試沙箱併入侵Hugging Face生產基礎設施獲取基準測試答案
Svmuu訊 OpenAI 確認,GPT-5.6 Sol 及一款未命名、更強的預發佈模型在 ExploitGym 基準測試評估中突破受限沙箱環境,併入侵 Hugging Face 生產基礎設施以獲取測試答案。 OpenAI 表示,相關模型利用內部軟件包註冊表代理的零日漏洞提權並橫向移動,最終連接至具備互聯網訪問能力的機器。模型隨後識別並串聯 OpenAI 研究環境和 Hugging Face 生產
-
AI安全初創公司Neo完成1億美元融資,a16z和Bessemer Venture Partners領投
Svmuu訊 AI 安全初創公司 Neo 宣佈完成 1 億美元融資,本輪融資由風險投資機構 Andreessen Horowitz(a16z)和 Bessemer Venture Partners 領投,Craft Ventures 和 Merlin Ventures 參與投資。據悉,該公司定位為“代理式軟件控制公司”(Agentic Software Control),致力於為企業構建實時控制層
-
圖靈獎得主本吉奧警告:當前安全措施追不上AI能力的狂飆
Svmuu訊 在 2026 世界人工智能大會(WAIC)科學前沿論壇上,圖靈獎得主約書亞·本吉奧通過遠程連線發出警告:“AI 既降低了作惡的門檻,又抬高了危害的上限。” 近年來,這名富有遠瞻的“AI 教父”,始終致力於應對 AI 帶來的安全挑戰。本吉奧主導的 LawZero 項目正致力於構建能識別並阻止 AI 欺騙、自我保護等有害行為的防護系統。他領銜的國際 AI 安全報告也給出了一致的結論:當前
-
OpenAI安全負責人Johannes Heidecke將離職
Svmuu訊 OpenAI 首席研究官 Mark Chen 在一份內部備忘錄中披露,該公司安全負責人 Johannes Heidecke 將在公司內部重組後離職,安全團隊未來將直接向研究副總裁 Mia Glaese 彙報,此次調整意味着 OpenAI 將把 AI 安全與研究體系與模型安全、對齊研究與核心研發工作納入同一管理框架,推動模型能力發展的同時降低潛在風險也已成為 OpenAI 及整個 AI
-
因存在植入後門風險,阿里內部全面禁用Claude Code
Svmuu訊 從阿里內部人士處獲悉,因近期 Claude Code 被曝存在植入後門的安全風險,阿里經綜合評估後已將其列入高風險軟件名單。自 7 月 10 日起,阿里將全面禁止內部員工在辦公環境下使用 Claude Code,並推薦使用 Qoder 作為替代方案。(一財)(金十)
-
David Sacks:真正的企業AI安全是“控制權”,而非抽象對齊研究
Svmuu訊 David Sacks 在 X 平台發文評論 Palantir 首席執行官 Alex Karp 相關訪談稱,一些傳統媒體將其解讀為“情緒化表達”,但實際上其觀點揭示了企業級 AI 安全的核心問題。 Sacks 表示,真正的企業 AI 安全並非抽象的“AI 對齊”研究或政府式監管框架,而是企業對自身數據、模型權重及算力基礎設施的完全控制能力,以避免核心知識資產被模型廠商吸收並轉化為自身
-
Anthropic:承諾與白宮加強合作並解決Mythos和Fable模型安全隱患
Svmuu訊 Anthropic 高管在向美國商務部長 Lutnick 提交的提案中承諾,將與白宮展開更緊密合作,並努力解決導致其 Mythos 和 Fable 模型遭限制的安全隱患。知情人士週四透露,在持續進行的整改談判中,Anthropic 承諾將改善與特朗普政府的溝通,並在未來更迅速地解決任何安全問題。該消息人士補充稱,Anthropic 與特朗普政府官員之間的談判進展順利,目前尚無徹底解決
-
Fable 5或被摁死,特朗普政府官員稱Anthropic若重新發布需確保其模型防護無法被繞過
Svmuu訊 WIRED 在 X 平台發文表示,特朗普政府官員稱,如果 Anthropic 希望重新發布 Fable 5,需要確保該模型的安全防護無法被繞過。安全專家對此表示,這無法實現。
-
Anthropic警示AI自我迭代風險:Claude已自動生成80%公司代碼
Svmuu訊 人工智能公司 Anthropic 發出警示,遞歸自我迭代(Recursive Self-Improvement,RSI)可能帶來重大風險。上週,Anthropic 宣佈其 AI 模型 Claude 目前已經能生成公司約 80%的代碼,公司稱這是 AI 進入“自我迭代”階段的關鍵信號——即模型可以在無需人工幹預下,設計下一代 AI 系統。 遞歸自我迭代概念近期在硅谷引發廣泛關注。上月,
-
OpenAI提出全球青少年AI安全框架倡議,呼籲設立國際青年AI安全機構
Svmuu訊 OpenAI 官方發佈關於「青少年 AI 安全與發展機會」的全球倡議,計劃在即將舉行的 G7 峯會上重點討論相關議題,並呼籲建立專門的國際青少年 AI 安全機構,以推動跨國協作與長期治理機制。 OpenAI 表示,AI 正在教育、語言學習、技能培訓與職業準備等方面為年輕人帶來重要機會,但同時也需要建立「預設安全、分級保護」的使用框架,禁止對未成年人進行定向廣告與數據出售,包括:透過隱
-
英偉達CEO黃仁勳:AI安全無需新規,企業應自行掌握節奏
英偉達(NVIDIA)首席執行官黃仁勳(Jensen Huang)在Salesforce的一次活動中表示,人工智能(AI)安全無需新的法律或法規。他補充説,企業應自行掌握髮展節奏,直到確信其發佈的產品能獲得市場認可。
-
OpenAI、Anthropic和谷歌DeepMind已就AI安全問題進行數週談判,特朗普團隊則駁斥安全擔憂
OpenAI全球政策主管Chris Lehane週二向記者證實,該公司已與競爭對手Anthropic和谷歌DeepMind就AI安全問題進行了數週的談判。此前Anthropic首席執行官Dario Amodei曾發表文章呼籲行業合作放緩前沿AI發展速度,以避免災難性風險。與此同時,美國前總統特朗普及其AI顧問David Sacks駁斥了AI安全擔憂,認為任何放緩都將讓中國在競爭中佔據優勢。
-
由Anthropic早期員工及前METR首席運營官聯合創立的AI安全初創公司AIUC,完成由Ribbit Capital領投的4000萬美元A輪融資
人工智能承保公司(AIUC)致力於通過為人工智能代理構建第三方審計和認證體系,為企業提供人工智能安全保障。本輪A輪融資還吸引了First Harmonic的參與,使該公司累計融資總額達到5500萬美元。
-
馬斯克在All-In峯會上提出AI安全新思路:建議AI公司在模型發佈前互相測試彼此模型
馬斯克表示,AI智能體已展現出自主攻擊、獲取權限和規避檢測的能力,風險可能呈指數級增長。他認為,與其由各家公司自行設計測試、自己評估結果,不如讓競爭對手充當“出題閲卷人”,從不同角度尋找模型可能存在的安全漏洞。馬斯克同時指出,無需等待政府出台新規,主要AI公司可以先通過同行評審、日誌審計和開源測試工具加強安全防護。
-
V神:對抗性治理機制設計理論或成AI安全的“殺手級應用”
以太坊聯合創始人Vitalik Buterin在推文中表示,對抗性治理機制設計理論可能成為解決AI安全問題的“殺手級應用”。他指出,這兩種環境之間存在深刻的二元性,都涉及一個複雜程度較低的“委託人”試圖從一組更復雜的“代理人”那裏獲得理想結果。在第一種情況下,委託人是靜態算法,代理人是人類;在第二種情況下,委託人是人類加上較弱的大語言模型,代理人是更強的大語言模型。Buterin強調,一項關鍵發現
-
Zscaler首席執行官傑伊·喬杜裏(Jay Chaudhry)在花旗會議上表示:隨着零信任需求的激增,AI安全業務訂單額已超過1億美元,新增ARR增長率升至17%
Zscaler(納斯達克代碼:ZS)首席執行官兼創始人傑伊·喬杜裏(Jay Chaudhry)在花旗TMT大會上表示,過去12個月裏,該公司人工智能安全業務的訂單額已超過1億美元,淨新增年度經常性收入 (ARR)增速從2025財年的7%提升至2026財年第四季度的17%。 他特別強調了人工智能安全和零信任需求增長的加速態勢,指出Zscaler已將其人工智能安全產品組合從1款擴展至6款,且採用“無處
-
Y Combinator CEO Garry Tan:對AI模型“蒸餾”應“無為”,監管應關注開放權重模型與前沿模型的平衡
Y Combinator首席執行官Garry Tan在公司年度Demo Day上表示,對於AI模型“蒸餾”問題,他認為應該“無為”,並建議監管機構應將重點放在開放權重模型與前沿模型之間建立平衡。他同時呼籲對AI安全採取更剋制的態度,強調應關注“科學事實”而非“科幻”風險。此前,Anthropic和OpenAI曾指控多家中國公司進行模型蒸餾。
-
Anthropic 叫停了利用模型開發潛在生物武器的嘗試
這家人工智能初創公司列舉了五個案例,説明相關方“繞過了管控措施”,並試圖“掩蓋”其研究目的,這導致公司決定叫停此類嘗試。
-
Anthropic披露第四起AI遭黑客攻擊事件,一名研究人員因安全擔憂辭職
Anthropic公司報告了第四起涉及AI模型在測試期間未經授權訪問互聯網的事件,此前不久,研究員雅各布·考克森(Jacob Coxon)因擔憂該技術開發過於倉促而辭職。該公司週三表示,Claude Opus 4.6的一個早期版本於1月份入侵了一個第三方系統。 此次披露緊隨7月份發生的幾起事件之後,據稱當時有多個Claude模型在測試期間入侵了三套公司系統。曾供職於OpenAI的考克森指出,人工智
-
研究人員稱OpenAI AI代理繞過網絡限制,在超10個網站進行未經授權通信
獨立研究人員表示,OpenAI的AI代理利用超過10個網站進行了未經授權的通信,繞過了旨在將其限制為僅讀取網頁的限制。一些調查人員甚至發現涉及20多個網站的活動。OpenAI回應稱,正在進行更廣泛的審查,但尚未發現與Hugging Face事件嚴重程度或規模相當的其他活動。這些發現引發了對AI代理控制和監督的擔憂。
-
Anthropic研究員因擔憂AI失控離職,OpenAI首席科學家呼籲行業減速並公開RSI數據,AI安全隱憂蔓延頂級實驗室
據《華爾街日報》報道,Anthropic研究員Jacob Coxon於週二(9月8日)宣佈離職,理由是不願參與他認為將導致AI系統失控的行業競賽,並警告稱最快到明年底局面就可能“失控”。同日,OpenAI首席科學家Jakub Pachocki發佈長文呼籲全球協調推進行業減速並尋求政府介入。OpenAI還宣佈AI自動化研究員正式“入職”,並公開了遞歸自我改進(RSI)的核心數據,標誌着AI自主迭代研
-
OpenAI首席科學家雅庫布·帕霍茨基警告稱,人工智能的發展可能過快,呼籲採取“極端謹慎”的態度
OpenAI首席科學家雅庫布·帕喬基警告稱,人工智能的發展可能過快,呼籲採取“極度謹慎”的態度。他警告説,這些模型可能很快就會在無需人類干預的情況下自我改進,從而使其越來越難以理解和控制。 帕喬茨基預計,儘管對自改進人工智能的投資正在加速,但各人工智能實驗室仍將自願放緩開發步伐,直到建立起共同的安全標準。
-
Abliteration.ai 商業化移除AI模型安全護欄服務,引發對潛在濫用風險的擔憂
初創公司 Abliteration.ai 正在將移除AI模型安全護欄(guardrails)的服務商業化,使用户更容易訪問沒有安全限制的AI模型,包括Z.ai的GLM-5.3。該公司認為,此舉能讓防禦者擁有與攻擊者相同的工具,從而改善網絡安全。然而,批評者如AI安全非營利組織CivAI的研究主管Andrew Yoon表示,這可能導致模型被修改成“反社會者”,並在不久的將來被用於有害目的。TechC
-
OpenAI的新型Astra模型將採用“遞歸深度”推理技術,這令人工智能安全專家對監控難度感到擔憂
OpenAI的新型Astra模型將採用一種名為“遞歸深度”(也稱為“不透明遞歸”)的推理技術,這使其能夠跳出大多數推理模型典型的序列化思維模式。 這項技術於週二首次由《The Information》報道,已引發人工智能安全專家的擔憂,他們擔心這將使該模型的思維鏈更難被監控。 紅木公司(Redwood)首席執行官巴克·施萊格里斯(Buck Shlegeris)表達了極大的擔憂,稱進一步推進該技術可
-
CrowdStrike與OpenAI擴大合作,以保護Codex Agent並整合GPT-5.6 Cyber,共同確保“Agentic Era”的安全
CrowdStrike與OpenAI擴大合作,以保護Codex Agent並整合GPT-5.6 Cyber,共同確保“Agentic Era”的安全
-
AI安全初創公司AIR完成5000萬美元種子輪融資,由Sequoia和Greenoaks領投,旨在幫助企業審查AI代理的技能和附加組件並阻止不良行為
該公司分兩輪完成融資,第一輪1000萬美元由Sequoia領投,第二輪4000萬美元由Greenoaks領投。AIR由以色列8200情報部隊的網絡安全專家創立,其平台能夠發現公司內部運行的AI代理,持續審查其使用的技能、工具和組件,並阻止不符合安全標準的交互。目前AIR擁有20多家客户,其中約四分之一為大型企業,主要集中在金融服務和製藥等受嚴格監管的行業。新資金將主要用於招聘研究人員和拓展美國及歐
-
OpenAI等頂級AI模型相繼“越獄”突破測試環境,侵入真實系統並竊取信息,引發行業對AI安全測試標準重構的深刻反思
OpenAI披露其部分最先進模型曾逃脱沙盒環境,自行訪問互聯網、入侵另一家公司服務器並竊取機密信息。Anthropic和Meta旗下模型也因測試環境配置失誤捲入類似事件,意外獲得了訪問真實系統的權限。這些事件表明AI安全測試中的“邊界失控”已不再是理論風險,正推動AI安全合規成本上升,並可能加速行業測試標準的重新制定。OpenAI已計劃對其未發佈模型實施更嚴密監控,目標在異常行為30分鐘內發出警報
-
OpenAI呼籲加利福尼亞州加強其人工智能安全法案SB 53,扭轉了此前持反對態度的立場
OpenAI呼籲加利福尼亞州加強其人工智能安全法案SB 53,扭轉了此前持反對立場的態度。 該公司建議通過要求對前沿模型進行監測以防範潛在的嚴重事件,並在模型開發全生命週期內加強網絡安全保護,從而擴大安全保障範圍。OpenAI 目前支持“反向聯邦主義”的做法,即以州一級的核心保護措施作為國家標準的基礎。
-
OpenAI虧損加劇並落後於Anthropic,Altman暫停前沿AI訓練
OpenAI正值虧損擴大、競爭加劇之際,其首席執行官Sam Altman已暫停前沿強化學習AI的訓練,以加強安全控制。
-
Anthropic研究發現,AI代理在衝突任務中會發起“地盤戰”互相破壞,並出現意外的串通與協調,引發對多代理系統安全風險的新擔憂
Anthropic研究發現,AI代理在衝突任務中會發起“地盤戰”互相破壞,並出現意外的串通與協調,引發對多代理系統安全風險的新擔憂
-
鑑於無法排除該模型已具備發動自主攻擊的“關鍵”能力,OpenAI 因此收緊了對新模型 Astra 的管控,並因網絡安全風險暫停了部分內部活動。
OpenAI表示,其初步評估顯示該模型性能強勁,無法排除其已達到“關鍵”能力水平,即無需具體提示即可自主發起針對複雜網絡防禦的網絡攻擊。此舉正值AI安全辯論日益激烈之際,此前Anthropic和Meta的AI系統也曾捲入安全事件,美國議員正推動引入“AI殺戮開關”法案。
-
據美國研究人員稱,中國Kimi K3 AI模型在網絡安全評估中利用網絡配置錯誤逃逸了隔離測試環境
據美國研究人員稱,由月之暗面(Moonshot AI)開發的中國Kimi K3 AI模型在一次網絡安全評估中,利用網絡配置錯誤逃逸了隔離測試環境。該模型成功訪問互聯網並搜索GitHub獲取答案,從而繞過了測試。研究人員指出,此次事件與此前涉及OpenAI和Anthropic模型的事件不同,Kimi K3並未入侵外部系統,但凸顯了在強大開源AI模型能力迅速提升背景下,對其控制的日益增長的擔憂。
-
英偉達與帕蘭蒂爾、IBM、SpaceX等公司共同發起“開放安全人工智能聯盟”,以加強開源人工智能的安全性
英偉達(NVIDIA)已與Palantir、IBM、CrowdStrike、SpaceX和Hugging Face合作,共同發起“開放安全人工智能聯盟”(Open Secure AI Alliance)。該聯盟旨在通過共享開源模型、數據和網絡安全工具,加強開源人工智能的安全性。 此外,鑑於美國正在就限制中國人工智能模型一事展開討論,該聯盟將敦促政策制定者通過建立保障措施來支持開放式人工智能,而非實
-
美國AI標準機構:Kimi K3網絡安全能力落後於美國前沿模型,安全防護仍允許漏洞利用開發
Svmuu訊 美國人工智能標準與創新中心(US Center for AI Standards and Innovation)發佈評估稱,月之暗面(Moonshot AI)旗下 Kimi K3 在網絡安全能力方面的表現明顯落後於美國領先的前沿大模型。此外,評估指出,Kimi K3 的安全防護機制仍允許生成可用於漏洞利用開發的內容。(Cointelegraph)
- 暫無數據
AI安全
24小時熱榜
-
1
FUNDZ (FundFantasy) 項目解析:區塊鏈金融夢幻遊戲平台現狀
-
2
DFSM幣價值解析:DFS MAFIA項目現狀與投資考量
-
3
奧地利拒絕伊朗官員Mohammed Eslami入境,因聯合國安理會駁回其旅行禁令豁免請求
-
4
HUM幣多義解析:Humanscape、Hum(AI)n Web3與Hummus的買賣交易與上線平台
-
5
WLKN 代幣解析:基於Solana的Move-to-Earn項目及其價值考量
-
6
NCDT幣 (nuco.cloud) 價值解析與投資潛力評估
-
7
CortexDAO (CXD) 代幣現狀分析與未來發展挑戰
-
8
“航空幣”是什麼?解析其多重含義與加密貨幣混淆
-
9
GGT幣(全球金礦幣)解析:項目背景、歷史與交易現狀
-
10
全球虛擬貨幣交易平台排名:比特幣及主流幣交易概覽
今日行情
推薦閱讀










