ldraw-nova: AI agent'lar LEGO modellerini Python koduyla tasarlıyor
ldraw-nova'da modeller ham koordinat yerine bir plan ve Python generator yazıyor; ama fiziği ya da dengeyi hiçbir şey test etmiyor.
Reasoning Jeeves'i 5 puan isabetli yaptı ama p90 gecikmeyi 17 s'ye çıkardı; yalnızca güven 0.9 altındayken düşünmek kazancın çoğunu koruyor.

9B'lik bir sınıflandırıcı, cevap vermeden önce düşünebildiğinde beş puan daha isabetli oldu. Medyan yanıt süresi 0.3 saniyeden 3.3'e çıktı.
PostHog bugün Jeeves'i açık kaynak yaptı: evet/hayır, çoktan seçmeli ve puanlama soruları için küçük bir karar modeli. Ticket yönlendirme ya da içerik işaretleme gibi işlerin arkasındaki çağrı türü.
Asıl acıtan kuyruk. Tam reasoning ile tek bir H100'de p90 gecikme 17 saniyeye ulaşıyor.
Ortadaki ayar kopyalanmaya değer. Model önce düşünmeden cevap veriyor ve yalnızca güveni 0.9'un altındaysa, sınırlı bir zincirle reasoning yapıyor. Dev setlerinde bu, kazancın çoğunu koruyor: 0.825'e karşı 0.806, 2 saniyelik medyan ve p90'da 6'nın altında.
Bir sınıflandırıcıya reasoning eklemeden önce:
Reasoning bir bütçedir. Onu belirsiz durumlara harcayın.
Bu yazı İngilizce aslından Türkçeye çevrilmiştir.