ldraw-nova: AI agent'lar LEGO modellerini Python koduyla tasarlıyor
ldraw-nova'da modeller ham koordinat yerine bir plan ve Python generator yazıyor; ama fiziği ya da dengeyi hiçbir şey test etmiyor.
livenerf doğrulamasında doğruluktaki gürültü gerçek değişimden büyüktü; effort değişimini ise output token sayıları net gösterdi.

Birkaç haftada bir, biri bir modelin lansmandan sonra kötüleştiğine yemin ediyor. Neredeyse kimse bunu kontrol edecek bir lansman günü baseline'ı tutmamış oluyor.
Bir geliştirici, Claude Opus 5.5 için çıkış gününde bir tane başlattı. Adı livenerf, bir gecede Hacker News ön sayfasına çıktı ve okumaya değer kısmı doğrulama çalışması.
Birebir aynı iki çalıştırma yaklaşık 6 doğruluk puanı farklı çıktı. Effort'u high'dan medium'a düşürmek doğruluğu yaklaşık 4 puan oynattı. Gürültü, değişimden büyüktü.
Bunu output token'lar yakaladı. Medium effort onları yaklaşık dörtte bir, low ise yaklaşık %60 azalttı. Yerine eski Opus 5'i koymak ise hiç ayırt edilemedi.
Kendi uygulamanızda drift'i yakalamak için:
Doğruluk gürültülüdür. Token sayıları ucuz bir kanıttır.
Bu yazı İngilizce aslından Türkçeye çevrilmiştir.