Coinbase는 10월 7일, Onramp 서비스에 대한 과거 리플레이 벤치마크 테스트 결과, 세 가지 주요 AI 모델 제품군(Opus 5, Sonnet 5, GPT-5.6)의 새로운 버전이 사기성 결제 탐지에서 이전 버전보다 사기 사례 수와 사기 금액 비율 모두에서 더 낮은 포착률을 보였다고 보고했습니다. 이는 의사결정 전략이 변경되지 않았음에도 불구하고 발생했습니다. 특히 Sonnet의 재현율은 22.2%p 하락했고, Opus의 재현율은 0.8%p 하락했습니다. GPT의 정밀도는 11.5%p 향상되었지만, 재현율은 20.7%p 하락하여 더 많은 사기 사례와 사기 금액이 탐지되지 않았음을 시사합니다.