Nemotron 3.5 Lightning ve NeMo Switchyard çıktı: Tek model yerine yönlendirme ne kazandırıyor?
NVIDIA, 30 milyar parametreli seyrek modeliyle yüksek hacimli ajan görevlerini; açık yönlendirme kütüphanesiyle de her isteği uygun modele dağıtmayı hedefliyor.
1 okunma4 dk okumaNVIDIA Blog — Nemotron 3.5 Lightning and NeMo Switchyard

Her yapay zekâ görevi en büyük modele gönderildiğinde maliyet ve gecikme hızla büyüyor. NVIDIA, Nemotron 3.5 Lightning modelini ve NeMo Switchyard yönlendirme kütüphanesini 11 Ağustos 2026'da duyurarak iki parçalı bir çözüm sundu: yüksek hacimli ajan işleri için daha verimli açık model, görevleri uygun açık veya kapalı modele dağıtmak için yönlendirici.
Nemotron 3.5 Lightning, model kartına göre toplam 30 milyar parametreli, her adımda yaklaşık 3 milyar etkin parametre kullanan karışık uzmanlı bir model. Bir milyon tokene kadar bağlam desteği listeleniyor. Büyük bağlamın kullanılabilir olması, tek istekte bir milyon token vermenin hızlı, ucuz veya doğru olacağı anlamına gelmez; bellek, donanım ve dikkat kalitesi ayrı sınırlar getirir.
Switchyard ne yapıyor?
NeMo Switchyard, gelen görevin türüne göre farklı modeller arasında seçim yapmayı amaçlayan açık bir yönlendirme katmanı. Basit sınıflandırma küçük ve hızlı modele, karmaşık planlama daha güçlü modele gidebilir. Kurum açık ağırlıklı, NVIDIA ve haricî sağlayıcı modellerini aynı politika içinde değerlendirebilir.
Yönlendirici kendiliğinden en iyi kararı garanti etmez. Yanlış sınıflandırılan zor görev ucuz fakat yetersiz modele gidebilir; hassas veri izin verilmeyen sağlayıcıya yönlenebilir. Bu nedenle kalite, maliyet ve veri bölgesi kuralları birlikte yazılmalıdır.
Nasıl başlanır?
Geliştirici model kartını, lisansı ve örnek sunum seçeneklerini inceler. Küçük pilotta görevler “özetleme, kod, araç kullanımı, uzun belge” gibi sınıflara ayrılır. Her sınıf için kabul edilebilir kalite eşiği, en yüksek maliyet ve izinli sağlayıcı tanımlanır. Switchyard yönlendirme kararı ile sonucun başarısı günlükte tutulur.
Örnek yönlendirme politikası:
“Kişisel veri içeren istekleri yalnız kurum içi barındırılan modele gönder. Beş yüz kelimeden kısa sınıflandırma görevlerinde düşük maliyetli modeli dene. Kod değişikliği, para işlemi veya düşük güven puanında güçlü modele yükselt ve insan onayı iste.”
Bu metin kavramsal örnektir; gerçek yapılandırma resmî kütüphane şemasına göre yapılmalıdır.
Üç somut kullanım örneği
- Binlerce destek kaydını küçük modelle sınıflandırıp yalnız belirsiz olanları güçlü modele yükseltmek.
- Kod ajanında dosya keşfini hızlı modele, mimari değişiklik planını daha güçlü modele vermek.
- Uzun kurum belgelerinde hassas bölümleri yerel modele, kamuya açık genel soruları haricî modele yönlendirmek.
Performans iddiaları
NVIDIA, Lightning'in kendi kıyaslarında sınıfındaki modellere göre dört kata kadar çıktı hızı ve ajan görevinde yüzde 30 daha kısa tamamlanma süresi sunduğunu belirtiyor. Bunlar üretici ve ortak ölçümleridir; kullanılan GPU, nicemleme, sunucu ve görev karışımı sonucu değiştirebilir. Kendi donanımınızda aynı istekleri en az üç kez ölçmeden kapasite planı yapılmamalı.
Erişim ve maliyet
Model Hugging Face, ModelScope, OpenRouter, NVIDIA'nın build hizmeti ve NIM seçenekleriyle sunuluyor; Switchyard kodu açık kaynak kanallarından erişilebilir. “Açık model” donanım, barındırma ve ağ maliyetini ortadan kaldırmaz. Bir milyon bağlam ve yüksek eşzamanlılık güçlü GPU altyapısı gerektirebilir. Bilgiler 1 Eylül 2026'da kontrol edildi; lisans ve sağlayıcı fiyatı seçilen dağıtıma göre doğrulanmalı.
Sınırlar ve güvenlik
Model yanlış araç çağrısı, uydurma kaynak veya güvensiz kod üretebilir. Uzun bağlamda gizli bilgi istem dışı başka çıktıya taşınabilir. Yönlendirme günlükleri de istem içeriği tuttuğu için hassas veri sayılmalı. Her sağlayıcı için veri saklama, bölge ve alt işlemci koşulları kaydedilmelidir.
Rota değişikliği sessiz kalite düşüşü yaratabilir. Model sürümü sabitlenmeli, kritik görevlerde kanarya testi ve geri dönüş yolu bulunmalı. En ucuz rota değil, kalite eşiğini geçen en uygun rota hedeflenmelidir.
Yönlendirici nasıl sınanır?
Önce geçmiş işlerden kolay, orta, zor ve hassas etiketli bir test kümesi hazırlanır. Beklenen model rotası ve kabul edilebilir sonuç her örnek için önceden yazılır. Switchyard çalıştırıldığında yalnız son cevap değil, seçilen model, güven puanı, gecikme ve maliyet kaydedilir. Zor görevi küçük modele gönderen ve hassas görevi izin verilmeyen sağlayıcıya yönelten hatalar ayrı ağır kusur sayılır.
Yönlendirme politikası değiştiğinde aynı küme tekrar çalıştırılmalıdır. Model sağlayıcısı kesildiğinde geri dönüş rotasının veri bölgesi ve kalite kuralını koruduğu doğrulanmalı. Deney trafiği ile gerçek kullanıcı trafiği ayrılmalı; rota günlükleri erişim kontrolünde tutulmalıdır. Aylık rapor yalnız tasarrufu değil, yükseltme oranını, yanlış rota etkisini ve insan düzeltme süresini de göstermelidir.
Kullanıcıya sonuç hangi modelden geldiği her zaman gösterilmese bile kurum içi denetim kaydında model ve sürüm bulunmalıdır. A/B testi sırasında aynı kullanıcı görevinin farklı sağlayıcılara gitmesi veri sözleşmelerini ihlal etmemeli. Rota kararını etkileyen özellikler kişisel veya hassas veri taşımamalıdır. Yönlendiricinin kendisi güncellendiğinde yalnız model performansı değil politika uyumu da regresyon testine alınmalıdır.
Kritik rotalar için otomatik durdurma ve insana devretme eşiği önceden tanımlanmalı; eşiklerin çalıştığı düzenli tatbikatla doğrulanmalıdır.
Okuyucu bugün on gerçek görevi “kolay, zor, hassas” diye ayırıp hangi modelin neden seçileceğini tabloya dökebilir. Yapay zekâ altyapısını tek model yarışından ölçülebilir iş akışına çevirmek için Mülk Rehberi Gazetesi'ni takip edin.
