Coinbaseは10月7日、Onrampサービスの過去のリプレイベンチマークテストにおいて、主要なAIモデルファミリー(Opus 5、Sonnet 5、GPT-5.6)の新しいバージョンが、不正な支払いの検出において、検出された不正事例の数と不正金額の割合の両方で、意思決定戦略が変更されていないにもかかわらず、以前のバージョンを下回ったと報告しました。特に、Sonnetのリコール率は22.2ポイント、Opusのリコール率は0.8ポイント低下しました。GPTの精度は11.5ポイント向上しましたが、リコール率は20.7ポイント低下しており、これはより多くの不正事例と不正金額が検出されなかったことを示唆しています。