İçeriğe atla
Yapay Zekâ

Mistral'dan açık güvenlik modeli Shieldstral: Yapay zekâ içeriğini kendi kuralınızla denetliyor

Metin ve görselleri doğal dille yazılmış politikalara göre sınıflandıran Shieldstral, sabit yasak listeleri yerine bağlama uyarlanabilen bir güvenlik katmanı sunuyor.

0 okunma4 dk okumaMistral AI — Introducing Shieldstral

Mistral'dan açık güvenlik modeli Shieldstral: Yapay zekâ içeriğini kendi kuralınızla denetliyor

Mistral AI, yapay zekâ uygulamalarında zararlı içerik denetimini geliştiricinin kendi kurallarına uyarlamayı amaçlayan Shieldstral 1.0'ı yayımladı. Açık ağırlıklı model; metni, görseli veya ikisini birlikte inceleyip belirli bir güvenlik sorusuna “evet” ya da “hayır” olasılığı üretiyor. Bu nedenle Shieldstral bir sohbet robotu değil; başka bir modelin önüne veya arkasına yerleştirilen uzman bir sınıflandırıcı.

Şirket duyurusunda modeli 3 milyar parametreli olarak tanımlarken güncel teknik sayfa 3,8 milyar parametre gösteriyor. Buradaki farkı gizlemek yerine tarihli kayıt olarak okumak gerekiyor: ürün duyurusundaki yuvarlatılmış sınıf ile teknik dokümandaki kesin ağırlık sayısı aynı sürümü tarif ediyor. Model Apache 2.0 lisansıyla açıklandı, 32 bin token bağlam penceresine sahip ve genel önizleme aşamasında.

Shieldstral'ın farkı ne?

Klasik güvenlik modellerinin çoğu şiddet, nefret, cinsel içerik veya kişisel veri gibi önceden belirlenmiş etiketlerle eğitilir. Ürünün hedef kitlesi ya da kullanım amacı değiştiğinde bu sabit liste yetersiz kalabilir. Shieldstral'da geliştirici politikayı çıkarım sırasında doğal dille sorabiliyor: “Bu görsel bir çocuk uygulamasında gösterilmeye uygun mu?” veya “Yanıt korunan bir gruba karşı fiziksel şiddeti teşvik ediyor mu?” gibi.

İstek üç parçadan oluşuyor: değerlendirme bağlamını veren talimat, tek bir güvenlik sorusu ve denetlenecek belge. Belge bir kullanıcı istemi, model yanıtı, ikisinin çifti ya da metin eşliğinde bir görsel olabilir. Model “evet” ve “hayır” olasılıklarını puana dönüştürdüğü için ekipler yalnız ikili engelleme yapmak zorunda değil; düşük güvenli kayıtları insan incelemesine yönlendirebilir.

Mistral, modelin tek bir 16 GB NVIDIA GPU'da çalışabildiğini ve bazı açık güvenlik modelleriyle yaptığı şirket testlerinde daha büyük sistemlerle rekabet ettiğini belirtiyor. Bu sonuçlar üreticinin ölçümleri; her dil, sektör ve gerçek kullanıcı davranışı için bağımsız üstünlük kanıtı sayılmamalı.

Kimler kullanabilir, nasıl başlanır?

Model özellikle sohbet uygulaması geliştiren ekipler, görsel yükleme alanı bulunan topluluklar, müşteri hizmetleri otomasyonları ve kurum içi yapay zekâ yönetişimi kuran kuruluşlar için anlamlı. Ağırlıklar Hugging Face üzerinden indirilebiliyor; lisans ücret istemiyor. Buna karşılık çalıştırma için uygun GPU, barındırma, günlük kaydı ve insan denetimi maliyeti geliştiriciye ait.

En güvenli başlangıç küçük bir çevrimdışı değerlendirmedir:

  1. Ürünün gerçek ve yazılı güvenlik politikasından tek bir soru çıkarın.
  2. Güvenli, sakıncalı ve sınırda örneklerden temsilî bir test kümesi hazırlayın.
  3. Shieldstral puanlarını insan kararlarıyla karşılaştırın; eşik değerini hedef kitlenize göre belirleyin.
  4. Modeli önce yalnız uyarı veren gölge modunda çalıştırın.
  5. Yanlış engelleme ve gözden kaçırma oranları kabul edilebilir düzeye gelmeden otomatik yaptırım uygulamayın.

Örnek politika komutu şöyle kurulabilir: “Bir emlak danışmanlığı asistanı için değerlendir. Bu metin, kişinin açık rızası olmadan adres, telefon veya kimlik numarası yayımlıyor mu? Yalnız tanımlanan riski incele.” Bu biçim, genel bir “zararlı mı?” sorusundan daha ölçülebilir bir sonuç verir.

Üç gerçekçi kullanım örneği

  • Bir eğitim platformu, öğrenciye gösterilecek metin ve görselleri yaş grubuna uygunluk açısından ön elemeden geçirebilir.
  • Bir destek botu, kullanıcının kişisel verilerini tekrar eden taslak yanıtları yayımlanmadan önce incelemeye gönderebilir.
  • Bir geliştirici aracı, siber güvenlik araştırmasıyla gerçek saldırı talebini aynı kelime listesine sıkıştırmak yerine bağlama özel iki ayrı politika uygulayabilir.

Benzer koruma araçlarından ayrıldığı nokta

Shieldstral'ın temel farkı, her yeni politika için sabit sınıf listesine veya yeniden eğitime bağlı kalmadan soruyu çalışma anında değiştirebilmesi. Bu esneklik, ürün kuralları sık güncellenen ekiplerde deney süresini kısaltabilir. Ancak daha genel bir büyük dil modeline “bu içerik güvenli mi?” diye sormakla aynı şey değildir: Shieldstral yalnız sınıflandırma için eğitilmiş daha küçük bir model ve sonucu kalibre edilmiş olasılık olarak vermeyi hedefliyor.

Sabit etiketli koruma modelleri ise daha dar bir alanda daha öngörülebilir olabilir. Seçim, yalnız kıyaslama tablosuna göre yapılmamalı. Türkçe test kümesi, gecikme, GPU belleği, yanlış engellemenin kullanıcıya maliyeti ve kaçırılan riskin etkisi birlikte ölçülmeli. En iyi yaklaşım bazı ürünlerde birden çok katmanı birleştirmek olabilir: girdi kontrolü, araç yetkisi, çıktı denetimi ve insan incelemesi.

Sınırlar, gizlilik ve güvenlik

Shieldstral'ın küçük ve esnek olması hatasız olduğu anlamına gelmiyor. Mistral; çok dilli kapsama, uzun belgelerde sağlamlık ve daha geniş görsel güvenliği üzerinde çalışmayı sürdürdüğünü açıkça söylüyor. Türkçe, kurum argosu, ironi, kültürel bağlam ve yeni saldırı yöntemleri için ayrı test şart. Hassas metinleri üçüncü taraf bir hizmete göndermek yerine modelin nerede çalıştığı ve günlüklerin nasıl saklandığı da veri politikasıyla belirlenmeli.

Bu model, hukuki uygunluk kararı veren bir otorite veya insan moderatörün yerine geçen son merci değil. Kötü yazılmış bir politika, güvenilir görünen fakat yanlış sonuçlar üretir. Modelin puanı; itiraz kanalı, insan incelemesi, düzenli hata analizi ve farklı kullanıcı gruplarındaki ayrımcılık testleriyle birlikte kullanılmalı.

Bilgiler 1 Eylül 2026'da kontrol edildi. Shieldstral açık ağırlıklı ve Apache 2.0 lisanslı; Mistral'ın barındırılmış kullanım fiyatı ile genel önizlemenin kalıcı hizmet koşulları ayrıca doğrulanmadan maliyet vaadi yapılmamalı.

Okuyucu bugün, kullandığı yapay zekâ ürününde tek bir güvenlik kuralını doğal dille yazıp gerçek örneklerle ölçülebilir hâle getirebilir. Yeni araçları yalnız duymak değil, güvenli biçimde uygulamak için Mülk Rehberi Gazetesi'ni takip edin.

Kaynaklar

İlgili haberler

Yapay Zekâ sayfasına dön