原帖内容

Frontier LLM Coding Benchmark - Double Pendulum Challenge: Fable 5.1 x GLM 5.3 x GPT-6 Astra x Qwen 3.8 Effort: Max & Ultra Task: Bu taskta modelden, tam nonlinear double pendulum fiziğini gerçek RK4 integrasyonu ile simüle eden ve bunu sinematik, seyir odaklı bir Canvas 2D deneyimine dönüştüren tek dosyalık bir HTML uygulaması üretmesi bekleniyor. Zorluk: Fizik doğruluğunu korurken sabit timestep, enerji korunumu ve kaotik ayrışma gibi nümerik gereksinimleri; glow trail, kamera hareketi, HiDPI render ve sahne koreografisiyle aynı anda yönetebilmesinde. Özellikle chaos modunda mikroskobik başlangıç farklarının gerçekten fizik üzerinden büyümesi ve bunun görsel olarak etkileyici ama performanslı biçimde sunulması modelleri zorluyor. Modellerin çözüm maliyeti ve süresi: - GLM 5.3 - 4.5 dolar - 58m - GPT‑6 Astra - non - 32m - Fable 5.1 - 22 dolar - 1h 25m - Qwen3.8-max - 5.4 dolar - 2h 11m Overall Puanlamalar: ☄️ GPT-6 Astra - 97,5/100 Fable 5.1 - 91,5 GPT 5.6 Sol - 91,0 GLM 5.3 - 89,0 Qwen 3.8 - 87,5 Astra neden birinci? - Kanonik denklemler ve eksiksiz RK4 kullanıyor. - 500 rastgele durumda türev hatası 0; yüksek açısal hızlarda da denklemleri değiştirmiyor. - NaN, Infinity, negatif parametreler ve geçersiz durumların tamamını reddediyor. - Self-check enerji sapması yalnızca 8,09×10⁻⁸. - Zaman damgalı dünya-koordinatlı, kuadratik yumuşatılmış, üç geçişli iz sistemi çok güçlü. - Altı sinematik sahnenin tamamını uyguluyor; gerçek simülasyon zamanıyla senkron ilerliyor. - Canlı diverjans doğrudan sahne üzerinde gösteriliyor. - Play/Pause, kaos, instance count, epsilon, seeded randomization ve invalid-state durdurma testleri geçti. - Harici kaynak, sahte fizik, kontrol hatası veya otomatik başarısızlık sebebi bulunmadı.