Yapay zeka ajanlarına yönelik yeni bir DDoS saldırısı olarak “Maliyet Tüketme Saldırısı”

Tokenomik nedir ve yapay zeka tokenlerinin değeri nasıl bir siber güvenlik sorunu haline geldi?

Siber Güvenlik Tokenomisi: Maliyet Tüketme Saldırısı

Kısa bir süre önce, pek çok şirket çok çeşitli iş akışlarında yapay zeka ajanlarını aktif olarak kullanmaya başladı. Kısa sürede, bu teknolojileri kullanmanın maliyeti şirketler için acil bir sorun haline geldi. Üstelik bu, sadece finans departmanını ilgilendiren bir konu değildir. Bütçeyle ilgili endişelerin yanı sıra, güvenilirlik, operasyonel istikrar ve hatta bilgi güvenliği gibi konular da gündeme gelmektedir. Bunun nedeni, aynı sürecin otomasyon maliyetinin bir uygulamadan diğerine önemli ölçüde farklılık göstermesi, öngörülemez olması ve dış etkenlere bağlı olabilmesidir.

Ayrıca, bir kuruluşa saldırı düzenleyen kötü niyetli bir aktör için, yapay zeka kullanılarak otomatikleştirilmiş ve dış etkenlere karşı zayıf noktası olan her türlü süreç, özünde “yeni tür bir DDoS saldırısı” için kolay bir hedeftir. Uygulama hata raporları, ürün yorumları veya teknik destek talepleri (tıpkı bir şirketin yapay zeka aracılığıyla işlediği diğer tüm harici veriler gibi), belirteçlerin (LLM’nin girdi ve çıktısının temel birimi olarak işlev gören kelime parçaları) tüketimini artırmayı amaçlayan bir saldırıda bir araç olarak kullanılabilir.

Faturalar açısından muazzam bir büyüme yılı…

2026 yılında, büyük şirketler ilk kez yapay zeka sistemlerine ayrılan bütçelerini önemli ölçüde aştılar. Uber, yıllık bütçesinin tamamını Nisan ayına kadar harcadı, ismi açıklanmayan bir şirket ise Claude için harcama limitleri belirlememiş ve bir ayda 500 milyon dolar harcamıştır. Yapay zeka sağlayıcıları düzenli olarak daha düşük fiyatlar ve daha verimli modeller duyuruyor olsa da, sohbet robotlarından sürekli ve otonom bir şekilde çalışan ajan tabanlı sistemlere geçiş, token tüketimini yüzlerce ya da binlerce kat arttırmaktadır.  Aynı zamanda, şirketlere yönelik “20 veya 100 dolarlık sabit abonelik” modeli artık geçmişte kalmakta; tüm büyük sağlayıcılar, kurumsal müşterileri “kullandıkça öde” faturalandırma sistemine geçmektedir.

Sonuç olarak, şirketler bulut barındırma ve mobil iletişim sektörlerinde fazlasıyla tanıdık bir sorunla karşı karşıya kalmaktadır. Özel maliyet muhasebesi ve yönetim sistemlerinin bulunmaması durumunda, bir kuruluş belirli bir sürecin veya projenin ne kadara mal olacağını ancak bu süreç veya proje tamamlandıktan sonra öğrenebilir. Telekom ve bulut sektörlerinde bu sorun, gelişmiş faturalandırma sistemlerinin geliştirilmesi sayesinde nihayet çözüldü; bu sektörlerdeki müşteriler, hatta FinOps adlı özel bir terimi bile benimsedi. Yapay zeka açısından bu süreç hâlâ emekleme aşamasındadır. Ayrıca, üretken yapay zekanın olasılıksal doğası, sorunun çözümünü daha da karmaşık hale getirecektir.

Öngörülemeyen token tüketimi

Maliyetlerin neden bu kadar hızlı arttığını ve tahmin edilip kontrol edilmesinin neden bu kadar zor olduğunu anlamak için, bir dil modelinin nasıl çalıştığına ve onu bir yapay zeka ajanı haline getiren unsurlara bakmamız gerekir. Model durum bilgisi içermez; başka bir deyişle, etkileşimler arasında hiçbir bilgiyi saklamaz. Ajan bir sonraki adımı attığı her seferinde, belirli bir görevle ilgili tüm çalışma geçmişi (bağlam) modele yeniden gönderilmelidir: İlk komut, önceki akıl yürütme süreci, okuduğu dosyaların içeriği ve tüm araçlardan gelen yanıtlar. Her adımda bu “özet” daha da uzar; özellikle de görev yinelemeli döngüler içeriyorsa. Bir adım başarısız olursa, yanıt net değilse veya bir araç hata verirse, ajan basitçe tekrar dener ve bu da bağlamın boyutunu daha da büyütür. Ve eğer görev tek bir ajan tarafından değil de, işi kendi aralarında paylaşıp sonuçlarını birbirleriyle paylaşan birkaç ajan tarafından yerine getiriliyorsa, bu hacim ajan sayısıyla çarpılır. Sonuç olarak, token tüketimi kademeli olarak değil, ani artışlarla gerçekleşir ve görevin başında bunu tahmin etmek neredeyse imkansızdır.

Bir yapay zeka ajanın etkileşimine ait iki farklı oturumu, tam olarak aynı görevi çözmek amacıyla çalıştırıldığında (iki teknik destek talebi, iki analiz görevi vb.), bu oturumlarda harcanan belirteç sayısı farklılık gösterebilir. Bu fark, 30 katına kadar olabilir. Bu, görevin tamamlanması için kaç adım, hata ve yeniden deneme gerektiğine bağlıdır. Kaynak tüketiminin artması, her zaman görevin karmaşıklığına bağlı değildir. Yapay zekanın bir düşünce döngüsüne saplanıp önemsiz görevler için absürt derecede fazla kaynak harcadığı çok sayıda örnek bilinmektedir.

Kurumsal sistemlerdeki üç nesil yapay zeka sistemi, kaynakları tamamen farklı şekillerde tüketir:

  • Klasik makine öğrenimi (ML): Bu yöntem genellikle iyi yapılandırılmış verilerle işe yarar ve hesaplama açısından çok yoğun değildir. Kaynak tüketimi öngörülebilir ve düşüktür. Bu, sabit bir bütçe kalemidir;
  • Bir sohbet robotu veya diğer büyük dil modeli (LLM) tabanlı yapay zeka asistanı: Bu işlem belirteç tüketir, ancak hızı bir insan belirler: Bir çalışan görevi manuel olarak başlatır, ardından sonucu değerlendirir ve işlemi duraklatır. Maliyet, aktif kullanıcı sayısıyla kabaca orantılı olarak artar ve lisans sayısına göre yaklaşık olarak tahmin edilebilir;
  • Otonom bir yapay zeka ajanı: Bir kişi bir hedef belirler ve geri çekilir; ardından sistem ne yapılacağına ve kaç adım atılması gerektiğine kendi başına karar verir. Görev tamamlanmış sayılana kadar sayaç çalışmaya devam eder ve öngörülebilir bir maliyet üst sınırı yoktur.

Saldırılarda tokenomik: Yeni Maliyet Tüketme Saldırısı türü olarak cüzdan erişimini engelleme

LLM çağrıları, tipik standart yazılım çağrılarına kıyasla önemli ölçüde daha pahalı olduğundan, kurumsal rutin görevlerin otomatikleştirilmesi alışılmadık derecede yüksek bir maliyet gerektirir. Örneğin, Gartner, bir LLM kullanarak tek bir müşteri destek talebini çözmenin maliyetinin yaklaşık 3 $ olduğunu tahmin etmektedir. Saldırganların, ucuz bir LLM tarafından üretilen binlerce uzun ve karmaşık isteklerle bir şirketi nasıl bombardımana tutarak önemli maddi zarara yol açabileceğini hayal etmek hiç de zor değildir. Süreç otomatik olduğu için, anormallikler hemen tespit edilemeyebilir.

Bir saldırgan, bir iş sürecinde hangi ajan sisteminin ve hangi büyük dil modelinin (LLM) kullanıldığını bilirse, daha hedefli bir saldırı gerçekleştirebilir ve çok daha büyük hasara yol açabilir. GitInject araştırmasının yazarları, hata analizi için yapay zeka ajanları kullanan bir kuruluş içinde tek bir saldırıyla (GitHub’un savunma mekanizmaları devreye girmeden önce) GitHub sorunları oluşturabilen bir saldırganın, kurbanın hesabından 111 $’a kadar zarar verebileceğini ve 400 dakikalık GitHub Actions kotasını tüketebileceğini tahmin ettiler. Elbette, böyle bir saldırı saldırgana herhangi bir maliyet getirmeden defalarca tekrarlanabilir.

Parasal açıdan ölçülmesi zor olsa da en tehlikeli risk, büyük dil modellerini (LLM’ler) aşırı akıl yürütmeye sevk eden saldırılardan kaynaklanır. OverThink başlıklı makalede yazarlar, zararsız bir şekilde ifade edilmiş bir görevin bir dil modeline girildiğinde nihayetinde doğru bir sonuç verdiğini, ancak bu süreçte olması gerekenden 46 kat daha fazla belirteç tükettiğini ortaya koydu. Ayrıca, araştırmacılar tarafından test edilen tüm görevler mevcut güvenlik filtrelerini başarıyla geçti.

OWASP Dil Modelleri için En Önemli Riskler kılavuzunun yeni sürümünde, bu sorun rekor düzeyde yüksek bir önceliğe taşındı: Sınırsız token tüketimi artık LLM06:2026 olarak tanımlanmakta ve bunun varyantları arasında, kurbanın LLM’ler için ayrılmış bütçesini tüketen “Maliyet Tüketme Saldırısı” özellikle vurgulanmaktadır.

“Yeni DDoS” Saldırısının Kurbanı Olmaktan Nasıl Kaçınılır?

Her şeyden önce, “sırf kullanmak için yapay zeka kullanmak” ilkesinden vazgeçmelisiniz. Her görevi otonom ajanlara emanet etmek mantıklı değildir. Yapay zeka kullanımına ilişkin periyodik olarak bir maliyet-fayda analizi yapmak akıllıca olacaktır.

Buna ek olarak, otonom bir yapay zeka ajanının kullanabileceği izinleri ve araç setini sınırlamalısınız. Sistemin erişebileceği eylemler ne kadar az olursa, dar kapsamlı bir görevde o kadar etkili çalışır, maliyetleri şişirme olasılığı o kadar azalır ve birinin sistemi “manipüle ederek” gereksiz token harcamalarına yöneltme ihtimali o kadar azalır.

Ayrıca, token tüketimine katı sınırlar getirilmesini ve bu sınırlar aşıldığında kullanıcıları uyarmak üzere bir bildirim sisteminin kurulmasını öneriyoruz. Birden fazla sınırlamayı paralel olarak uygulamak mantıklıdır: görev başına bir sınır, günlük bir sınır vb. sınır aşımlarına ilişkin uyarılar, süreçlerin devam ettirilip ettirilmeyeceğine dair bilinçli bir karar verebilmesi için derhal sistemden sorumlu uzmana iletilmelidir.

Harici, güvenilir olmayan verileri mutlaka doğrulayın. Yapay zeka tarafından işlenen ve dış kaynaklardan gelen her türlü bilgi (istekler, sorgular, mesajlar veya yorumlar ya da rastgele metin içerebilen çeşitli teknik alanlar (DNS kayıtları, HTTP başlıkları, dosya adları gibi) sadece prompt enjeksiyonuna yol açmakla kalmaz, aynı zamanda iş yükünü kasıtlı olarak artırabilir. Bunların boyutlarını sınırlamak ve oluşturdukları yükü izlemek akıllıca olacaktır.

İşin birim maliyetini hesaplayın ve tedarikçinin faturalarını kendi verilerinizle karşılaştırın. Analiz başına, istek başına veya kontrol başına maliyet, ne için ödeme yaptığınızı anlamanın ve faturalardaki hataları tespit etmenin tek yoludur.

İpuçları