NVIDIA Nemotron 3.5 Lightning ve NeMo Switchyard: Ajanlarda Doğru İş, Doğru Model

by

⏱️ 13 dk tahmini okuma süresi
📝 2274 kelime
♿ WCAG 2.2 Uyumlu
Bu Makaleyi Sesli Dinleyin
Doğal Türkçe ses sentezleyici hazır



NVIDIA, sürekli çalışan yapay zekâ ajanlarında her görevi en büyük modele göndermek yerine, işi uzmanlaşmış modellere paylaştıran yeni bir yaklaşım sunuyor. 11 Ağustos 2026’da duyurulan Nemotron 3.5 Lightning, toplam 30 milyar fakat her belirteçte yaklaşık 3 milyar etkin parametre kullanan açık ağırlıklı bir model. Aynı gün yayımlanan NeMo Switchyard ise istekleri kalite, gecikme ve maliyet hedeflerine göre farklı modellere yönlendiren açık kaynaklı bir katman.

Bu ikili, “tek model her işi yapsın” anlayışından “doğru iş doğru modele gitsin” mimarisine geçişi temsil ediyor. Ancak duyurudaki hız ve maliyet rakamlarının büyük bölümü NVIDIA ve iş ortaklarının kendi ölçümlerine dayanıyor. Üstelik Switchyard henüz pre-alpha aşamasında ve proje deposu yazılımın üretim ortamında kullanılmaması gerektiğini açıkça belirtiyor. Dolayısıyla haber, güçlü bir teknik yönelim olarak okunmalı; hazır ve risksiz bir kurumsal çözüm ilanı olarak değil.

Kısa cevap: NVIDIA ne duyurdu?

  • Nemotron 3.5 Lightning: Uzun süren ajan görevleri, araç kullanımı, kodlama ve yüksek hacimli uzman iş yükleri için tasarlanmış açık ağırlıklı bir dil modeli.
  • NeMo Switchyard: OpenAI, Anthropic ve OpenAI uyumlu uç noktalar arasında protokol çevirisi yapabilen; istekleri farklı modellere dağıtabilen açık kaynaklı Rust proxy’si ve kitaplığı.
  • Temel hedef: Her adımda pahalı bir öncü model çalıştırmak yerine, kolay görevleri küçük ve hızlı modellere; zor görevleri daha güçlü modellere göndererek kalite, hız ve maliyet arasında denge kurmak.
  • Yerel çalışma seçeneği: Model kartında DGX Spark, H100/H200 ve RTX 5090 gibi NVIDIA donanımları desteklenen seçenekler arasında sayılıyor. Bu, hassas veriyi kurum içinde tutma ihtiyacı bulunan uygulamalar için önemli.

Nemotron 3.5 Lightning nasıl bir model?

Nemotron 3.5 Lightning bir mixture-of-experts, yani uzmanlar karışımı modeli. Toplam 30 milyar parametreye sahip olsa da bir üretim adımında bunların yaklaşık 3 milyarı etkinleşiyor. Amaç, daha büyük bir modelin temsil kapasitesini korurken her istek için bütün ağı çalıştırmanın maliyetinden kaçınmak.

Mimari yalnızca klasik Transformer katmanlarından oluşmuyor. Model kartına göre Mamba-2, MoE ve seçili attention katmanlarını bir araya getiren hibrit bir tasarım kullanılıyor. Ayrıca Multi-Token Prediction ve spekülatif çözümleme seçenekleriyle bir defada birden fazla gelecek belirteci tahmin ederek üretimi hızlandırmaya çalışıyor. Modelin bağlam penceresi en fazla 1 milyon belirteç olarak belirtiliyor; ancak gerçek bellek tüketimi, hız ve kararlılık kullanılan donanıma, eşzamanlı kullanıcı sayısına ve çalışma zamanı ayarlarına göre ciddi biçimde değişebilir.

NVIDIA, Lightning’in aynı sınıftaki modellere kıyasla çıktıyı dört kata kadar daha hızlı üretebildiğini ve ajan görevlerini yüzde 30 daha kısa sürede tamamlayabildiğini söylüyor. Bunlar dikkat çekici değerler olsa da duyuru metnindeki karşılaştırmalar şirketin kendi testlerine dayanıyor. Model kartında yayımlanan değerlendirmeler daha yeniden üretilebilir bir zemin sunuyor; yine de sonuçların kurumun gerçek veri ve araç zincirinde ayrıca sınanması gerekiyor.

Model kartındaki somut teknik bilgiler

  • Toplam/etkin parametre: 30 milyar / yaklaşık 3 milyar.
  • Mimari: Mamba-2, uzmanlar karışımı ve attention bileşenlerini kullanan hibrit yapı.
  • Bağlam uzunluğu: En fazla 1 milyon belirteç.
  • Ön eğitim verisi kesim tarihi: Eylül 2025; son eğitim verisi kesim tarihi Mayıs 2026.
  • Desteklenen doğal diller: İngilizce, İspanyolca, Fransızca, Almanca, İtalyanca ve Japonca. Türkçe resmî destek listesinde yer almıyor.
  • Lisans: OpenMDW 1.1. Model kartı ticari kullanıma hazır olduğunu belirtiyor; buna rağmen lisans koşulları dağıtım öncesinde hukuk ekibince incelenmeli.
  • Dağıtım: Model kartı tek DGX Spark veya tek H100 üzerinde çalışma tarifleri veriyor; Blackwell, Hopper ve belirli koşullarda Ampere desteği listeleniyor.

Model kartındaki NVIDIA ölçümlerinde NVFP4 sürümü; SWE-bench Verified’da 52,80, Terminal-Bench 2.1’de 23,46 ve PinchBench’te 83,43 puan alıyor. Bu puanlar farklı yetenek alanlarını ölçüyor ve birbirleriyle doğrudan karşılaştırılmamalı. NVIDIA, değerlendirme tariflerini NeMo Gym deposunda yayımladığını belirtiyor; bu şeffaflık olumlu olsa da bağımsız tekrarlar olmadan sonuçları evrensel performans garantisi saymak doğru olmaz.

NeMo Switchyard ne yapıyor?

Bir ajan, tek bir kullanıcı görevi sırasında planlama, belge özetleme, kod yazma, araç çağırma, hata ayıklama ve son yanıt üretme gibi farklı işler yapabilir. Bu adımların tamamı aynı zorlukta değildir. Switchyard, her isteği tek bir varsayılan modele göndermek yerine, görevin niteliğine göre uygun arka ucu seçmek için araya giriyor.

Projenin deposuna göre Switchyard; OpenAI Chat Completions, OpenAI Responses ve Anthropic Messages biçimleri arasında çeviri yapabiliyor. Arka uçta vLLM, NVIDIA NIM, Ollama veya OpenAI uyumlu başka bir hizmet kullanılabiliyor. Böylece Codex, Claude Code ya da OpenClaw gibi bir ajan kendi alıştığı API biçimini kullanırken, istek farklı bir açık modele yönlendirilebiliyor.

Dört yönlendirme yaklaşımı

  1. LLM sınıflandırıcısı: İsteğin içeriğini inceleyip zayıf ya da güçlü model katmanını seçiyor.
  2. Aşama yönlendiricisi: Araç sonuçları, hata sinyalleri ve konuşmanın bulunduğu aşama gibi mevcut işaretlerden yararlanıyor; her karar için ek model çağrısı gerektirmeyebiliyor.
  3. Yükseltme yönlendiricisi: İşi önce daha ekonomik modelde çalıştırıyor; ayrı bir değerlendirici yetersiz bulursa güçlü modele tekrar gönderiyor.
  4. Rastgele yönlendirme: A/B testi, temel karşılaştırma veya sabit trafik bölme deneyleri için kullanılıyor.

Switchyard ayrıca istek sayısı, hata, gecikme, belirteç kullanımı ve yönlendirme yükü için Prometheus ölçümleri sağlıyor. Bu özellik önemli; çünkü model yönlendirme ancak hangi isteğin nereye gittiği, ne kadar sürdüğü ve kaliteyi nasıl etkilediği izlenebiliyorsa yönetilebilir.

Maliyet iddiaları nasıl okunmalı?

NVIDIA’nın açıklamasına göre Switchyard, öncü düzey doğruluğu korurken görev maliyetini yalnızca Opus 4.8 kullanmaya kıyasla yaklaşık üçte bire indirebildi. İş ortaklarının paylaştığı sonuçlarda da farklı oranlar var: Classmethod yüzde 27 maliyet düşüşü, Ramp yüzde 58 maliyet ve yüzde 33 çalışma süresi düşüşü bildiriyor. LangChain ise 145 çok turlu görevde çağrıların yalnız yüzde 7’sini öncü modele yönlendirerek yüzde 74 maliyet azalması elde ettiğini, bunun karşılığında doğruluğun yüzde 6 düştüğünü söylüyor.

Son örnek, pazarlama başlıklarında kolayca kaybolan temel gerçeği gösteriyor: yönlendirme ücretsiz bir kazanç değil. Daha düşük maliyet; yanlış sınıflandırma, ikinci kez çalışma, ek gecikme veya kalite düşüşü getirebilir. En iyi yönlendirici, her kurumun görev dağılımına, hata maliyetine ve kabul eşiğine göre değişir.

Erişilebilir yapay zekâ açısından neden önemli?

Model yönlendirme yalnızca altyapı maliyetiyle ilgili değil. Doğru tasarlandığında erişilebilirlik kullanan kişiler için daha hızlı, daha özel ve daha tutarlı hizmetler kurulmasına yardımcı olabilir.

  • Daha düşük gecikme: Ekran okuyucu kullanan bir kişinin arayüzde beklemesi, görsel bir yüklenme göstergesini izlemek kadar kolay değildir. Kısa ve öngörülebilir yanıt süreleri etkileşimi daha anlaşılır hâle getirir.
  • Yerel veri işleme: Sağlık bilgisi, engellilik durumu, kişisel notlar veya kurum içi belgeler buluta gönderilmeden yerel modelde işlenebilir. Bu otomatik olarak güvenli olduğu anlamına gelmez; fakat veri akışını daraltmak için güçlü bir seçenek sunar.
  • Göreve özel model seçimi: Görsel açıklama, sade dilde yeniden yazım, kod erişilebilirliği denetimi ve belge özetleme aynı modelden en iyi sonucu almak zorunda değildir. Her görev uygun modele yönlendirilebilir.
  • Kesintiye dayanıklılık: Bulut hizmeti çalışmadığında yerel bir yedek modele geçiş, yardımcı teknolojiye bağımlı kullanıcılar için hizmet sürekliliğini artırabilir.

Bununla birlikte yönlendiricinin kendisi yeni bir hata noktasıdır. Örneğin acil bir sağlık metnini “kolay özet” olarak sınıflandırıp zayıf modele göndermek, biçimsel olarak akıcı fakat riskli bir yanıt üretebilir. Erişilebilirlik bağlamında hız kadar anlamın korunması, belirsizliğin açıkça ifade edilmesi ve gerektiğinde insan desteğine geçiş önemlidir.

Türkçe kullanıcılar için en büyük soru işareti

Nemotron 3.5 Lightning’in model kartında Türkçe desteklenen diller arasında sayılmıyor. Model Türkçe metin üretebilir; ancak bu, Türkçe’de güvenilir araç kullanımı, uzun bağlam, sade dil, kültürel uygunluk veya engellilik terminolojisi performansının doğrulandığı anlamına gelmez.

Türkiye’de bir erişilebilirlik hizmetinde üretime geçmeden önce en az şu alanlar ayrı ayrı ölçülmeli:

  • Türkçe karakterlerin, kişi ve kurum adlarının doğru korunması,
  • uzun ve karmaşık cümleleri anlam kaybetmeden sadeleştirme,
  • alternatif metinlerde nesne, konum ve bağlam doğruluğu,
  • ekran okuyucuya uygun başlık, liste ve bağlantı yapısı üretme,
  • araç çağrılarında Türkçe niyetleri doğru sınıflandırma,
  • engellilikle ilgili ayrımcı, küçümseyici veya tıbbileştirici dil kullanmama.

Üretime geçmeden önce uygulanabilir kontrol listesi

  1. Kurumunuza ait görev kümesi oluşturun: Sık kullanılan gerçek istekleri kolay, orta, zor ve yüksek riskli olarak etiketleyin.
  2. Tek model temel çizgisini ölçün: Yönlendirme eklemeden önce kalite, gecikme, maliyet ve hata oranını kaydedin.
  3. Yönlendirme kararlarını günlükleyin: Hangi isteğin hangi modele, hangi gerekçeyle gönderildiği denetlenebilir olmalı; hassas içerik kayıtlarda maskelenmeli.
  4. Yüksek riskli işleri sabitleyin: Sağlık, hukuk, finans, güvenlik ve kişisel haklarla ilgili görevleri yalnız maliyet amacıyla küçük modele düşürmeyin.
  5. Erişilebilir hata mesajları tasarlayın: Başarısız yönlendirme sessiz kalmamalı. Kullanıcıya ne olduğu, ne yapabileceği ve insan desteğine nasıl ulaşacağı açık metinle anlatılmalı.
  6. Klavye ve ekran okuyucuyla uçtan uca test edin: Modelin doğru yanıt vermesi tek başına yeterli değildir; yönlendirme katmanını kullanan arayüz de WCAG ölçütleriyle sınanmalı.
  7. Kalite kaybı bütçesi belirleyin: Maliyet azalırken kabul edilebilecek en yüksek hata ve gecikme artışını önceden tanımlayın.
  8. Pre-alpha sınırını dikkate alın: Switchyard API’lerinin değişebileceğini varsayın; sürümü sabitleyin, kapalı test yapın ve geri dönüş planı hazırlayın.

Kimler bugün denemeli, kimler beklemeli?

Deneysel ortamı bulunan geliştirici ekipler, farklı modelleri tek bir ajan arkasında karşılaştırmak, yerel çıkarımı ölçmek veya yönlendirme politikalarını gözlemlemek için Switchyard’ı inceleyebilir. Nemotron 3.5 Lightning de özellikle kod, araç kullanımı ve uzun süren alt ajan işleri için değerlendirme adayı olabilir.

Kritik hizmet işleten kurumlar ise doğrudan üretime geçmemeli. Switchyard’ın pre-alpha durumu, Türkçe için doğrulanmış destek bulunmaması, NVIDIA donanım bağımlılığı ve şirket içi benchmarkların sınırlılığı önce kontrollü bir pilot gerektiriyor. Erişilebilirlik veya sağlık gibi hata maliyeti yüksek alanlarda insan onayı ve güçlü modele zorunlu yükseltme mekanizması korunmalı.

Sonuç: Asıl yenilik tek model değil, model sistemi

Nemotron 3.5 Lightning tek başına hızlı bir açık model duyurusu. Switchyard ile birlikte okunduğunda daha önemli bir fikir ortaya çıkıyor: geleceğin ajanları bir “en iyi model” seçmek yerine, farklı güçteki modelleri görev bazında yöneten sistemler olacak.

Bu yaklaşım maliyeti düşürebilir, gecikmeyi azaltabilir ve hassas veriyi yerelde tutmayı kolaylaştırabilir. Erişilebilir yapay zekâ hizmetlerinde de daha hızlı yanıt, görev uzmanlığı ve kesintiye dayanıklılık sağlayabilir. Fakat yönlendirme kararı görünmez bir kalite kapısıdır; yanlış tasarlandığında kullanıcı neden daha zayıf yanıt aldığını bilemez. Başarı, yalnızca hızlı modeli kurmakta değil; açık ölçütler, denetlenebilir günlükler, Türkçe testleri, erişilebilir arayüz ve insan müdahalesiyle bütün sistemi güvenilir kılmakta yatıyor.

Kaynaklar

Editoryal not: Bu yazı NVIDIA duyurusunun çevirisi değildir. Duyuru, model kartı ve açık kaynak depo belgeleri karşılaştırılarak hazırlanmış özgün Türkçe analizdir. Performans ve tasarruf oranları ilgili şirketlerin kendi testlerinden gelir; bağımsız garanti olarak sunulmamıştır.

Bir yanıt yazın

E-posta adresiniz yayınlanmayacak. Gerekli alanlar * ile işaretlenmişlerdir

✅ Uygulama Başarıyla Güncellendi!
🟢 Profil Uygulandı