TechCrunch 보도에 따르면, AI 해석 가능성(interpretability) 스타트업 Goodfire는 목요일 비정상적인 AI 에이전트를 더 낮은 비용으로 포착하는 새로운 AI 모니터를 출시했다. 이 시스템은 AI 모델의 외부 출력이 아닌 내부 작동 방식을 직접 모니터링하며, 이상 징후가 발견될 때만 보조 AI를 호출해 심층 검사를 진행한다. Goodfire는 이러한 "내부에서 외부로(inside-out)" 접근 방식이 기존 방식보다 비용이 훨씬 저렴하다고 밝혔으며, Kimi K3 모델을 대상으로 한 테스트에서 1,500개 세션을 모니터링하는 데 약 51달러의 비용이 든 것으로 나타나, 다른 방식의 233달러에서 10,000달러에 비해 훨씬 낮았다.해당 시스템은 악의적인 해킹 세션의 94%를 포착했으며, 무해한 세션 중 8.7%만을 추가 검토로 보냈다. Goodfire의 모니터는 현재 Baseten 고객들에게 제공되고 있으며, 공격적 해킹, 화학·생물 무기 오용, 리워드 해킹(reward hacking) 등의 위험을 모니터링하는 데 사용할 수 있다.