研究表明,通過使用帶有內存處理功能和“監督器”組件的定製化框架,即使底層模型並未針對該任務進行優化,AI 代理也能表現得顯著更好。 例如,在交互式推理基準測試ARC-AGI-3中,配備該輔助框架的Claude Opus 5取得了100%的得分,而未配備時僅為30%。這凸顯了代理“支架”機制的重要性——該機制負責管理記憶、上下文和反饋,對於提升複雜多步驟操作中AI的性能和成本效率至關重要。