← Tüm terimler
Prompt Injection (İstem Enjeksiyonu)

Prompt Injection (İstem Enjeksiyonu) Nedir?

Prompt injection, yapay zekânın işlediği içeriğe, yani bir sayfaya, e-postaya veya tool sonucuna, operatörün amacını geçersiz kılmayı deneyen düşmanca talimatlar gizler; tool kullanan ajanlarda risk gerçek eylemlere dönüşür.

Son güncelleme: 21 Temmuz 2026

Prompt Injection Nasıl Çalışır

Prompt injection, bir yapay zekâ modelinin işlediği içeriğe, operatörün amacını geçersiz kılmak hedefiyle düşmanca talimatlar yerleştirilmesidir. Dil modeli, talimat ile veriyi temiz biçimde ayırmaz: bağlamındaki her şey, yani sistem prompt’u, kullanıcının isteği, çekilen bir web sayfası, bir e-posta, bir belge, bir tool çağrısının sonucu, modelin uyulacak bir şey olarak ele alabileceği metindir. Saldırgan bunu, talimatları modelin okuyacağı yere ekerek istismar eder.

İki biçim ayırt edilir. Doğrudan prompt injection, modelle etkileşen kullanıcıdan gelir; kullanıcı, modele verilen kuralları geçersiz kılacak girdiler kurgular. Dolaylı prompt injection ise kurumlar için daha tehlikeli olandır: talimatlar, modelin işi sırasında eriştiği içeriğin içine gizlenir; özetlediği bir web sayfası, önceliklendirdiği bir e-posta, analiz ettiği bir belge, tükettiği bir tool sonucu. Operatör kötü niyetli metni hiç görmez; model onunla görevin ortasında karşılaşır ve ona uyabilir.

Neden Önemli

Yalnızca soru yanıtlayan bir sohbet botunda başarılı bir injection kötü bir yanıt üretir; utandırıcıdır ama sınırlıdır. Yapay zekânın tool’ları ve kimlik bilgileri olduğunda risk kategori değiştirir. E-posta okuyan, veritabanı sorgulayan ve API çağıran bir ajan, davranışı okuduğu herhangi bir şeyle yönlendirilebilen bir ajandır: başarılı bir injection, ona erişebildiği veriyi dışarı sızdırtabilir veya kimlik bilgilerinin izin verdiği eylemleri tetikletebilir. Üstelik bu olurken ilgili her sistem, tamamen meşru ve doğrulanmış çağrılar görür.

Sorunu yapısal kılan, hiçbir model düzeyi filtrenin eksiksiz olmamasıdır. Tespit sezgileri ve güvenlik eğitimi çıtayı yükseltir; ama talimat ile veri arasındaki belirsizlik, dil modellerinin çalışma biçiminin doğasında vardır ve yeni atlatma yolları ortaya çıkmaya devam eder. Bu yüzden güvenlik ekipleri prompt injection’a oltalama saldırılarına yaklaştıkları gibi yaklaşır: ortadan kaldırılacak bir şey olarak değil, ara sıra hedefini bulacak bir şey olarak. Bu da tasarım sorusunu önlemeden patlama yarıçapına, yani blast radius’a kaydırır.

Derinlemesine Savunma

Çalışma varsayımı derinlemesine savunmadır: model çıktısını güvenilmeyen girdi olarak ele alın ve model kandırıldığında bile ayakta kalan kontrolleri kurun. Ajanlara en az ayrıcalıklı tool kapsamları verin; yönlendirilmiş bir ajan yalnızca meşru olarak elindekini kötüye kullanabilsin. Hangi tool’ların onun için var olduğunu izin listesiyle belirleyin; ajanın keşfedemediği bir tool, injection’ın çağıramayacağı bir tool’dur. Yıkıcı çağrılar için insan onayı isteyin; en zararlı eylemler, ajan onları neden önerirse önersin, bir insan için beklesin. Anormal davranışı yakalamak için her çağrıyı izleyin ve denetleyin; yanlış davranan bir ajanı anında durduran bir kill-switch bulundurun.

Bu kontrollerin ortak özelliği, modelin dışında, kimlik katmanında yaşamalarıdır. Injection’ın fark edilmesine, modelin ona direnmesine veya modelin iç işleyişine dair herhangi bir varsayıma bağlı değildirler: yetkilendirme eylem noktasında uygulanır; bu yüzden korkuluklar, model kandırılmış olsun ya da olmasın yerinde durur. Monosign’ınki gibi kimlik farkındalıklı bir MCP gateway, ele geçirilmiş bir ajanın gerçekte ne yapabileceğini sınırlar.

Sık sorulan sorular

Prompt injection tamamen önlenebilir mi?
Hayır. Talimat ile veri arasındaki belirsizlik, dil modellerinin metni işleme biçiminin doğasında vardır ve hiçbir filtre veya eğitim yöntemi bunu tamamen kapatamamıştır. Gerçekçi duruş, oltalama için kullanılanın aynısıdır: bazı injection’ların hedefini bulacağını varsayın ve başarılı olanın sınırlı kalacağı şekilde tasarlayın. En az ayrıcalıklı kapsamlar, izin listeli tool’lar, yıkıcı eylemler için insan onayı ve bir kill-switch, patlama yarıçapını sınırlar.
Prompt injection yalnızca sohbet botlarının sorunu mu?
Hayır; sohbet botları, riskin en düşük olduğu yerdir. Tool’u olmayan bir model yalnızca yanlış bir şey söyleyebilir; tool’ları ve kimlik bilgileri olan bir ajan ise yanlış bir şey yapabilir. Kuruluşlar ajanları e-postaya, veritabanlarına ve iş sistemlerine bağladıkça, bu ajanların okuduğu her içerik parçası olası bir komut kanalına dönüşür. Ajanik kurulumların riski sohbet penceresinin çok ötesine taşımasının nedeni budur.
Model zaten kandırılmışsa kimlik kontrolleri nasıl yardımcı olur?
Çünkü modele en başından beri güvenmezler. Kimlik katmanı yetkilendirmesi modelin dışında, önerilen eylemin gerçek bir çağrıya dönüştüğü noktada uygulanır: kapsamlar, izin listeleri, onaylar ve denetim, model onu ister dürüstçe ister bir saldırganın etkisi altında üretmiş olsun, her isteğe aynı şekilde uygulanır. Kandırılmış bir model her şeyi önerebilir; ama yalnızca kimliğinin yetkili olduğunu yürütebilir.