livenerf ve Claude Opus 5.5: model drift'ini önce output token yakalar

livenerf doğrulamasında doğruluktaki gürültü gerçek değişimden büyüktü; effort değişimini ise output token sayıları net gösterdi.

Opus 5.5 üzerinde livenerf doğrulaması: medium effort, high'a göre doğrulukta -4 puan ve token'da -%26; aynı çalıştırmalar arası 6 puan fark

Birkaç haftada bir, biri bir modelin lansmandan sonra kötüleştiğine yemin ediyor. Neredeyse kimse bunu kontrol edecek bir lansman günü baseline'ı tutmamış oluyor.

Bir geliştirici, Claude Opus 5.5 için çıkış gününde bir tane başlattı. Adı livenerf, bir gecede Hacker News ön sayfasına çıktı ve okumaya değer kısmı doğrulama çalışması.

Birebir aynı iki çalıştırma yaklaşık 6 doğruluk puanı farklı çıktı. Effort'u high'dan medium'a düşürmek doğruluğu yaklaşık 4 puan oynattı. Gürültü, değişimden büyüktü.

Bunu output token'lar yakaladı. Medium effort onları yaklaşık dörtte bir, low ise yaklaşık %60 azalttı. Yerine eski Opus 5'i koymak ise hiç ayırt edilemedi.

Kendi uygulamanızda drift'i yakalamak için:

  1. Eval skorlarının yanında istek başına output token'ları loglayın.
  2. Harness ve CLI sürümünüzü sabitleyin. Değişen bir harness, değişen bir model gibi görünür.
  3. Modelin yalnızca bazen doğru bildiği, dondurulmuş bir soru seti tutun.

Doğruluk gürültülüdür. Token sayıları ucuz bir kanıttır.

Bu yazı İngilizce aslından Türkçeye çevrilmiştir.

Videoyu LinkedIn'de izle ↗