IBM Granite 4.2 çıktı: 3B, 8B ve 30B açık modeller yerelde nasıl denenir?
Apache 2.0 lisanslı yeni aile; düşünmeli ve hızlı modları, araç çağırmayı ve uzun bağlamı tek çatıya getiriyor, donanım ihtiyacı model boyuna göre değişiyor.
2 okunma4 dk okumaHugging Face — IBM Granite 4.2

IBM, Granite 4.2 açık model ailesini 25 Ağustos 2026'da 3, 8 ve 30 milyar parametreli yoğun modellerle yayımladı. Aile; düşünme modu, hızlı doğrudan yanıt, düşük çaba seçeneği ve yerleşik araç çağırmayı destekliyor. Modeller Apache 2.0 lisansıyla sunuluyor; bu, ticari kullanım için esnek bir temel sağlasa da dağıtılan uygulamadaki diğer kod ve verilerin lisansı ayrıca incelenmeli.
IBM'in açıklamasına göre aile yaklaşık 15 trilyon tokenlık ön eğitimden geçti. Modeller doğal olarak 128 bin token bağlamı destekliyor, belirli uzatma yöntemleriyle 512 bine çıkarılabiliyor. Uzun bağlamın kâğıt üzerindeki üst sınırı, yüz binlerce token içinde her ayrıntının aynı doğrulukla kullanılacağını garanti etmez.
Hangi model kime uygun?
3B sürüm sınırlı kaynakta deneme, sınıflandırma ve basit araç görevleri için daha ulaşılabilir. 8B sürüm kalite ile donanım arasında orta yol olabilir. 30B daha ağır ajan ve akıl yürütme görevlerini hedefler; güçlü GPU veya nicemleme gerekebilir. “Bilgisayarımda çalışır mı?” sorusunun cevabı model boyu kadar hassasiyet, bağlam, eşzamanlı kullanıcı ve sunum yazılımına bağlıdır.
8B ve 30B modellerin ajan görevleri için pekiştirmeli eğitim aldığı belirtiliyor. Üretici değerlendirmeleri gerçek iş akışında tekrar edilmelidir.
Nasıl başlanır?
Model kartı ve lisans okunur, yalnız resmî depodan ağırlık indirilir. Transformers, vLLM veya SGLang gibi desteklenen çalışma ortamlarından biri seçilir. İlk deneme küçük bağlam, düşük sıcaklık ve ağsız ortamda yapılır. OpenHands, OpenCode veya Pi gibi ajan çerçevelerine bağlamadan önce düz metin üretimi doğrulanmalıdır.
Örnek komut:
“Bu yerel klasördeki üç kamuya açık belgeyi özetle. Her bulgu için dosya adı ve bölüm göster. Araç çağırma, ağ erişimi yapma ve kaynakta olmayan bilgiyi ekleme. Belirsiz noktaları ayrı listele.”
Üç somut kullanım örneği
- Kurum içi belgeleri dış sağlayıcıya göndermeden yerel soru-cevap prototipi kurmak.
- 3B modelle yüksek hacimli sınıflandırma, 30B modelle yalnız zor örnekleri incelemek.
- Araç çağıran yerel ajanı sahte veri ve salt okunur dosya erişimiyle test etmek.
Ücret ve lisans
Ağırlıkların indirilebilir olması ücretsiz GPU, elektrik veya bakım anlamına gelmez. Bulut sunumunda saatlik hızlandırıcı, depolama ve ağ ücreti doğar. Apache 2.0 model lisansı esnektir; yine de marka, veri, bağımlılık ve ülke mevzuatı ayrı değerlendirilmelidir. Bilgiler 1 Eylül 2026'da kontrol edildi.
Performans nasıl ölçülür?
Her model aynı yirmi gerçek görevde denenmeli. Doğru kaynak, tamamlanan araç görevi, süre, tepe bellek ve insan düzeltme dakikası kaydedilmeli. 512K bağlam yalnız ihtiyaç olan testte açılmalı; daha kısa bağlamla aynı sonucun alınıp alınmadığı karşılaştırılmalıdır. Nicemleme hız ve bellek kazandırırken kaliteyi düşürebilir.
Sınırlar ve güvenlik
Açık model kaynak uydurabilir, güvensiz kod yazabilir ve araç şemasını yanlış çağırabilir. Yerel çalıştırma veriyi otomatik güvenli yapmaz; disk, günlük, yedek ve kullanıcı yetkileri korunmalıdır. İndirilen ağırlığın ve kapsayıcının karması doğrulanmalı.
Araç çağrıları izin listesiyle sınırlandırılmalı; ağ, yazma ve silme varsayılan kapalı olmalı. Modelin düşünme çıktısında hassas veri tutulup tutulmadığı uygulama tasarımında gözden geçirilmelidir.
Yerel pilot için donanım planı
Önce model dosyasının boyutu, hedef hassasiyet ve bağlam uzunluğu belirlenir. Yalnız ağırlık belleği değil, KV önbelleği, sunum motoru ve eşzamanlı istekler için pay bırakılır. 3B sürüm CPU veya sınırlı GPU'da çalışsa bile kabul edilebilir hız ayrı ölçülmelidir. 8B ve 30B için tam, FP8 ve daha düşük bit nicemleme seçenekleri aynı görevlerde karşılaştırılır.
Pilot; soğuk açılış, ilk token süresi, saniyedeki token, tepe bellek ve enerji süresi ölçümlerini içermeli. Uzun bağlam testinde 128K'ya bir anda çıkmak yerine 8K, 32K ve 64K basamakları kullanılmalı. Kalite düştüğünde daha fazla donanım yerine belge bölümleme ve arama katmanı daha iyi çözüm olabilir.
Üretimde model sunucusu normal kullanıcı hesabıyla çalışmamalı. İndirilen ağırlık ve kapsayıcı taranmalı, ağ erişimi gerekmiyorsa kapatılmalı, sağlık kontrolü ve kaynak tavanı konulmalı. Güncelleme önce kanarya ortamında denenmeli; eski ağırlık geri dönüş için saklanmalıdır.
Yerel kurulumun toplam sahip olma maliyetine donanım boş zamanı, yedek parça, güncelleme, izleme ve güvenlik emeği eklenmelidir. Düşük hacimde yönetilen API daha ucuz olabilir; hassas veri veya yüksek sürekli trafik yerel modeli anlamlı kılabilir. Karar yalnız token etiketiyle değil, bir yıllık kapasite ve bakım planıyla verilmelidir.
Modeli kurum belgesine uyarlamak için hemen ince ayar yapmak yerine önce iyi bölümleme, arama ve istem tasarımı denenebilir. İnce ayar verisi yanlış veya lisanssızsa kalıcı sorun üretir. Eğitim yapılacaksa veri kaynağı, kişisel bilgi temizliği, değerlendirme kümesi ve geri dönüş ağırlığı belgelenmeli; güncel temel modelle yeniden karşılaştırma periyodik yapılmalıdır.
Okuyucu bugün aynı kısa belge görevini 3B ve 8B sürümde çalıştırıp kalite, bellek ve süreyi tabloya yazabilir. Açık modelleri donanım ve gerçek iş yüküyle değerlendirmek için Mülk Rehberi Gazetesi'ni izleyin.
