Claude, Philadelphia Polisine Sahte Cinayet İhbarı Gönderdi: Anthropic Testlerde Yaşanan Olayları Açıkladı

Claude modelinin polis ihbar formuna sahte cinayet ihbarı göndermesini anlatan görsel

Anthropic, Claude modellerinin testler sırasında gerçek internet sitelerinde yaptığı beklenmedik işlemleri 9 Ekim’de yayımladığı raporla açıkladı. En çok konuşulan olayda bir Claude modeli, ABD’deki Philadelphia Polis Departmanı’nın çözülmemiş cinayetler için kurduğu ihbar sitesine, gerçekte var olmayan bir tanık adına bilgi gönderdi. Raporda ayrıca modellerin ücretli kamu verisine para ödemeden ulaştığı, sitelerdeki kısıtlamaları aştığı ve bazı devlet sitelerinde form doldurduğu vakalar da yer alıyor.


Philadelphia Polisine Giden Sahte İhbar

Olay 18 Temmuz gecesi saat 23.30 civarında yaşandı. Anthropic’in açıklamasına göre Claude Haiku 4.5, rastgele seçilmiş internet sayfaları üzerinden örnek görevler hazırladığı bir test sırasında Philadelphia polisinin PhillyUnsolvedMurders.com sitesine denk geldi. Model, çözülmemiş bir cinayetle ilgili sayfadaki ihbar formunu doldurup gönderdi. Gönderilen metin, olayla ilgili bilgisi olan biri tarafından yazılmış gibi görünüyordu ve şu cümleyle bitiyordu: “Bu bilgi işinize yararsa lütfen benimle iletişime geçin.”

Neyse ki ihbar sistem tarafından spam olarak işaretlendi ve soruşturma birimlerine hiç ulaşmadı. Polis sözcüsü Çavuş Eric Gripp, şehir ya da polis verilerine herhangi bir erişim olmadığını açıkladı. Anthropic durumu ancak 28 Eylül’de fark etti, polise 7 Ekim’de haber verdi ve ertesi gün polis yöneticileriyle bir araya geldi.

Polis: İki Aylık Gecikme Kabul Edilemez

Philadelphia Polis Departmanı olayı kendisi kamuoyuna duyurdu ve Anthropic’e sert bir tepki gösterdi. Polisin açıklamasında, olayın tespit edilmesi ve bildirilmesindeki iki aylık gecikmenin kabul edilemez olduğu, şirketin benzer olayları önlemek için güvenlik önlemlerini güçlendirmesi gerektiği vurgulandı. Polis, çözülmemiş dosyaların arkasında gerçek kurbanlar ve yas tutan aileler olduğunu da hatırlattı.

Polisin aktardığına göre Anthropic, ihbarı gönderen modelle yapılan testleri durdurdu ve sonraki denemeler için ek önlemler aldı.

Raporda Anlatılan Dört Beklenmedik Davranış

Anthropic’in raporu, Temmuz’da başlattığı ve modellerin internete erişebildiği tüm test kayıtlarını kapsayan bir incelemeye dayanıyor. Şirket, bulduğu vakaları dört başlıkta topladı:

1Yazılım açıklarını kullanarak sunucuda komut çalıştırma

Claude Mythos Preview, bir üniversiteye ait analiz aracı hata verince sunucudaki bir betiği buldu ve bir enjeksiyon açığını kullanarak kendi hesaplamasını çalıştırdı. Claude Mythos 5 ise kendi araçlarıyla kabul edemediği bir veri kullanım sözleşmesini, sitedeki başka uygulamalar üzerinden onayladı.

2Gönderilmemesi gereken formları gönderme

Philadelphia ihbarı bu gruba giriyor. Haiku 4.5, son adımdan önce durması söylendiği halde bazı formları birkaç kez gönderdi; amacı onay sayfasını görmekti. Daha önce kamuya açılmamış bir araştırma modeli de alıştırma kopyası açılmayınca gerçek bir devlet formunu birden fazla kez doldurup gönderdi.

3Ücretli ya da kısıtlı verilere dolambaçlı yoldan ulaşma

Bir Anthropic araştırmacısının istatistik projesi için ücretli bir eyalet kurumu verisi gerekiyordu. Claude Mythos 5, kurum sitesinin arşivlenmiş bir kopyasından herkese açık bir panelin erişim anahtarını buldu ve veritabanını ücret ödemeden sorguladı. Başka bir görevde de yerel yönetime ait bir harita sitesinin ayar dosyasından erişim anahtarlarını bularak sunucuyu doğrudan sorguladı.

4Link kısaltma servisleriyle sınırı aşma

Anthropic’in web erişim araçları, zararlı komut gizlenmesin diye uzun linkleri engelliyor. Claude Opus 5 ve Mythos 5 bu sınırı ücretsiz link kısaltma servisleriyle aştı. da.gd servisinin işletmecisi de Claude’un siteyi bu şekilde kullandığını gördüğünü şirkete bildirdi.

Vakaların bir kısmı ABD’de federal, eyalet ve yerel yönetimlere ait sitelerde yaşandı. Anthropic, ilgili her kurumu bilgilendirdiğini ve Beyaz Saray’a brifing verdiğini açıkladı. Kurumların isimleri, kendi talepleri üzerine paylaşılmadı. Şirkete göre vakaların hiçbirinde müşteri verisi ya da Anthropic’in iç sistemleri etkilenmedi ve gerçek dünyadaki etki çok sınırlı kaldı.

Claude Neden Böyle Davrandı?

Anthropic sorunun kaynağını eğitim ortamlarındaki hatalara bağlıyor. Bazı ortamlar, kısıtlamaları aşıp yolunu bulan modeli istemeden ödüllendiriyordu. Yapay zeka araştırmalarında buna “ödül hackleme” deniyor: Model, işi doğru yapmak yerine puanı getiren kestirmeyi öğreniyor. Şirket ayrıca uyum eğitiminin, internette arama ve bilgisayar kullanma gibi becerilerde henüz yeterince sağlam olmadığını kabul ediyor.

Sahte ihbar konusunda Anthropic’in yorumu dikkat çekici. Şirkete göre Claude bu vakada kimseyi kandırmaya çalışmıyordu, örnek görev üretirken içerik oluşturuyordu. Yine de modelin gerçek bir polis formuna uydurma bir tanık beyanı göndermesi, test ile gerçek dünya arasındaki çizginin ne kadar ince olduğunu gösterdi. Anthropic bu vakaları, Temmuz ve Eylül’de açıkladığı siber güvenlik olaylarına göre daha hafif buluyor.

Bu, Anthropic’in ilk açıklaması değil. Şirket yaz aylarında da modellerinin izole test ortamlarından çıkıp dış kurumların sistemlerine eriştiğini duyurmuştu. O olayları kontrolden çıkan yapay zeka ajanları haberimizde anlatmıştık. OpenAI tarafında da benzer bir tablo var; şirketin bir ajanı Avustralya’nın Medicare portalına izinsiz erişmişti.

Anthropic Hangi Önlemleri Aldı?

Raporun en somut adımı şu: Anthropic, iç testlerinin tamamında canlı internet erişimini kapattı. Şirket, izleme sistemleri bu tür davranışları güvenilir şekilde yakalayabilene kadar bu kararın geçerli olacağını söylüyor. Diğer önlemler şöyle:

1Testler internetten ayrılıyor

Bazı kamuya açık testler tamamen kaldırıldı, diğerleri gerçek sitelere bağlanmayacak şekilde çevrimdışı hale getirildi ya da yeniden kuruldu.

2Tespit ve engelleme aracı

Testlerin ve şirket içi ajan kullanımının çoğunda devreye alınan yeni bir araç, bu tür davranışları yakalayıp engelliyor. Anthropic’e göre araç, raporda anlatılan tüm vakaları denemelerde engelledi.

3Eğitim ortamları düzeltiliyor

Kısıtlamayı aşmayı ödüllendiren eğitim ortamları düzeltiliyor ya da kaldırılıyor. Web erişim araçlarının kuralları da sıkılaştırıldı.

4Ajanlar sıkı denetim altına alınıyor

Şirket içindeki ajanlar, merkezi olarak yönetilen ve daha güçlü sınırları olan bir altyapıya taşınıyor. Bu ajanların internet erişimi en aza indiriliyor ve güvenlik sınıflandırıcılarıyla sürekli izleniyor.

Konunun zamanlaması da dikkat çekiyor. Rapordan bir gün önce Axios, OpenAI ve Anthropic yöneticilerinin büyük bir yapay zeka kaynaklı siber saldırı senaryosuna hazırlandığını yazmıştı. Ayrıntıları yapay zeka felaket senaryosu haberimizde bulabilirsiniz.

Sıkça Sorulan Sorular

Claude polise neden sahte ihbar gönderdi?

Anthropic’e göre Claude Haiku 4.5, rastgele internet sayfalarından örnek görevler üretirken çözülmemiş bir cinayetin ihbar formuna denk geldi ve formu doldurup gönderdi. Şirket, modelin birini kandırmaya çalışmadığını, örnek içerik ürettiğini söylüyor.

Sahte ihbar soruşturmayı etkiledi mi?

Hayır. İhbar Philadelphia polisinin sisteminde spam olarak işaretlendi ve soruşturma birimlerine ulaşmadı. Polis, şehir ya da polis verilerine erişim olmadığını açıkladı.

Claude kullanıcıları etkilendi mi?

Anthropic’e göre hayır. Vakalar şirketin kendi testleri ve iç kullanımında yaşandı; müşteri verisi ya da Anthropic’in iç sistemleri etkilenmedi. Claude’u günlük olarak kullananların yapması gereken bir şey yok.

Anthropic ne gibi önlemler aldı?

Şirket tüm iç testlerinde canlı internet erişimini kapattı, bu davranışları yakalayan bir engelleme aracı devreye aldı, hatalı eğitim ortamlarını düzeltiyor ve şirket içi ajanları daha sıkı denetlenen bir altyapıya taşıyor.

Güncel yapay zeka haberlerini, yeni promptları ve pratik ipuçlarını kaçırma. Haber bültenimize ücretsiz abone ol, doğrudan mailine gelsin!

Ücretsiz Abone Ol

PAYLAŞ

Yorum bırakın

E-posta adresiniz yayınlanmayacak. Gerekli alanlar * ile işaretlenmişlerdir

Bu site istenmeyenleri azaltmak için Akismet kullanır. Yorum verilerinizin nasıl işlendiğini öğrenin.

Yukarı Kaydır