İçeriğe geç

Pekiştirmeli Öğrenme & Karar Sistemleri

Değişen koşullara uyum sağlayan karar politikaları, ödül tasarımı, simülasyonda eğitim ve sahaya güvenli aktarım.

Pekiştirmeli Öğrenme & Karar Sistemleri

Neden bu alanda çalışıyoruz

Bazı problemlerde doğru cevap sabit değil: karşı taraf da davranışını değiştiriyor. Statik bir kural seti ya da bir kez eğitilmiş bir sınıflandırıcı bu durumda öngörülebilir hale geliyor, öngörülebilir olan da aşılıyor.

Pekiştirmeli öğrenme bu problem sınıfına yanıt veriyor, ama kendi zorluklarını getiriyor: ödül yanlış tasarlandığında sistem istediğiniz şeyi değil ödülü optimize ediyor. Çalışmalarımızın ağırlığı bu yüzden ödül tasarımı ve güvenli keşif üzerinde.

Ne üzerinde çalışıyoruz

  • Ödül tasarımı ve ödül manipülasyonunun (reward hacking) tespiti
  • Simülasyonda eğitip sahaya aktarma; simülasyon–gerçeklik farkının kapatılması
  • Dil modelleriyle birlikte çalışan karar politikaları
  • Güvenli keşif: sistemin öğrenirken geri alınamaz bir hata yapmasının önlenmesi
  • Çok adımlı kararlarda başarının nasıl ölçüleceği ve politika regresyonunun yakalanması

Araştırma projelerimizden

Bu alandaki iki destekli projemiz de aynı fikirden çıkıyor: koruma stratejisi sabit kaldığında öngörülebilir oluyor. Hem yazılım koruma hem tehdit tespiti sistemlerimiz, karşılaştıkları duruma göre stratejilerini pekiştirmeli öğrenmeyle güncelliyor.

Yapay zeka projeniz için teknik değerlendirme

Projenizin fizibilitesi, riskleri ve takvimi teknik görüşmede değerlendirilir.