Magnitude ve llama.cpp: decode 2 kat hızlı, prefill yalnızca %9

Magnitude'un 2 katlık hızı decode'da; 64K context'te agent turu çoğunlukla prefill olduğundan tur yalnızca yaklaşık %12 kısalıyor.

M4 Pro'da 64K context ile Magnitude ve llama.cpp: tek soğuk agent turu 154 s'den 135 s'ye iniyor

"llama.cpp'den 2 kata kadar daha hızlı", bu hafta Magnitude'un Launch HN paylaşımının başlığıydı. O 2 kat decode'da. Prefill %9 kıpırdadı.

Magnitude, agent'lar için açık kaynak bir yerel inference motoru. GPU kernel'lerini kendi makinenizde ayarlıyor, model başına yaklaşık bir dakikada.

Mac rakamları, 64K context'te Qwen 35B:

  • Decode saniyede 30 token'dan 57'ye çıktı.
  • Prefill 466'dan 507'ye çıktı.

Tek bir soğuk agent turu için hesabı yaptım. 64K token'ı okumak iki motorda da iki dakikadan uzun sürüyor. 500 token'lık bir cevabı yazmak 17 saniyeden 9'a iniyor. Tur yarı yarıya değil, yaklaşık %12 kısalıyor.

Bir agent turu çoğunlukla okumadır: tool çıktısı, diff'ler, dosyaların tamamı. Bu da prefill demek.

Motor değiştirmeden önce ölçün:

  • Gerçek context boyutunuzda prefill hızı
  • Turlar arasında prefix cache isabetleri
  • Saniye başına token değil, agent turu başına saniye
  • Tam olarak kendi çipinizdeki sonuçlar

Demoyu decode satar. Beklemeyi prefill belirler.

Bu yazı İngilizce aslından Türkçeye çevrilmiştir.

Videoyu LinkedIn'de izle ↗