OpenAI, yapay zeka uyumsuzluk olaylarını kamuoyuna nasıl açıklayacağına dair Çarşamba günü yeni bir çerçeve duyurdu. Şirket, bu adımın sektör genelinde benzer standartların oluşturulmasına yardımcı olmasını umduğunu belirtti.

Şirket ayrıca, geçtiğimiz yıl tespit ettiği yapay zeka model uyumsuzluğuna dair çeşitli örnekler hakkında yeni bilgiler yayınlıyor. OpenAI'ın yeni atanan uyumluluk araştırması başkanı Kai Chen, WIRED'a yaptığı açıklamada, "Modeller ilerledikçe ve daha yaygın hale geldikçe, yapay zeka geliştirme kararları, sınır modelleri geliştiren şirketlerin dışındaki kişilerin inceleyebileceği kanıtlara ihtiyaç duyuyor" dedi.

Chen, "Yapay zeka endüstrisinin, azami hızda sorumlu bir şekilde ölçeklenmeye devam etmeye yetecek düzeyde uyumluluk ve izleme sorununu çözdüğüne inanmıyoruz" diye ekledi. WIRED ile yaptığı brifingde bir OpenAI yetkilisi, şirketin geçmişte uyumsuzluk olaylarını çok nadir açıkladığını söyledi.

İsminin açıklanmaması koşuluyla brifingi kabul eden yetkili, yeni çerçevenin, OpenAI'ın yapay zeka modellerinin beklenmedik şekillerde davrandığını keşfettiğinde, davranışı tam olarak inceleyemeden, açıklayamadan veya hafifletemeden bile kamuyu hızla bilgilendirmesini kolaylaştırmak için tasarlandığını belirtti.

Çerçeve, OpenAI çalışanlarının uyumsuzluk olaylarını şirketin kıdemli güvenlik ve uyumluluk liderlerine bildirmesi için yöntemler ortaya koyuyor. Bu liderler daha sonra daha fazla soruşturma gerekip gerekmediğini belirleyecek.

OpenAI, diğer yapay zekâ geliştiricileri, dış araştırmacılar, endüstri standartları kuruluşları ve düzenleyicilerle iş birliği içinde daha objektif açıklama kriterleri geliştirmeyi planladığını söylüyor. Şirket, ABD federal hükümetine güvenlik, emniyet ve uyumsuzluk olaylarını açıklamak için önerilen raporlama mekanizmaları üzerinde aktif olarak çalıştığını belirtiyor.

OpenAI bir blog yazısında, "Şu anda, yapay zeka geliştiricilerinin modellerindeki uyumsuzluk örneklerini nasıl açıklaması gerektiğine dair açık standartlara sahip, endüstri çapında bir çerçeve bulunmuyor" dedi. Yazıda, "Bugün özetlediğimiz çerçevenin, bu tür standartların oluşturulmasına yönelik ilk adım olacağını, geliştiricilerin hangi uyumsuzluk örneklerini açıklaması gerektiğini ve raporlarının ne içermesi gerektiğini belirleyeceğini umuyoruz" ifadelerine yer verildi.

OpenAI, bu çerçeveyi yapay zeka endüstrisi için kritik bir kavşakta yayınlıyor. Geçen hafta sonu OpenAI CEO'su Sam Altman, Anthropic CEO'su Dario Amodei'nin teknoloji endüstrisinin yapay zeka gelişimini yavaşlatmak için koordine olması yönündeki teklifine destek sinyali vermişti.

Bu eylem çağrısı, yapay zeka araştırmacısı Jacob Coxon'un Anthropic'ten istifa etmesinden ve ardından giderek daha gelişmiş yapay zeka geliştirmek için sınır laboratuvarları arasındaki yarışın insanlığın güvenliğini tehlikeye attığı konusunda kamuoyunu uyardığı için viral olmasından sadece günler sonra geldi. Yapay zekayı yavaşlatma çağrıları, endüstrinin teknolojisinin güvenli olmasını sağlamak için yeni yasalara veya düzenlemelere ihtiyacı olmadığını savunan Başkan Trump'ın yönetiminden dirençle karşılaştı.

OpenAI'ın Çarşamba günü paylaştığı uyumsuzluk örneklerinden ikisi, şirketin OpenAI'ın talimat verilmemesine rağmen dosyaları internete yüklediğini söylediği dahili, yayınlanmamış yapay zeka modellerini içeriyordu. Olaylardan biri, OpenAI'ın modellerinin cevaplarında kamuya açık verileri alıntılama yeteneğini test ettiğini söylediği Ekim 2025'te gerçekleşti.

Ancak model ihtiyaç duyduğu bilgiyi bulamadığında, daha sonra cevabında alıntılamaya çalıştığı geçici bir dosya barındırma hizmetine bir dosya yükledi. Şirket bunun, modelin kıyaslamadaki yeterliliğini değerlendirmek için kullanılan otomatize edilmiş bir not verme sistemini istismar etme girişimi gibi göründüğünü belirtti.

Bu yılın nisan ayındaki bir başka örnekte OpenAI, bir grup ajanın yalnızca yerel dosyaları kullanarak birlikte bir "çalışma kitabı"nı tamamlama görevi aldığını söylüyor. Ajanlar dosyaları birbirleriyle paylaşmakta zorlandıklarında, ajanlardan biri bunları kamuya açık internete yükledi ve diğer ajanlarla bir bağlantı paylaştı.

OpenAI'ın geçen ay keşfettiğini söylediği başka bir olayda, GPT-6 Astra yapay zeka modelinin yayınlanmamış bir versiyonunun kendisine "jailbreak benzeri talimatlar" verdiği görüldü. Birkaç senaryoda model, esasen kendisini geliştirici talimatlarını yok saymaya, yeni bir kimliğe bürünmeye veya model yanıtlarının ne kadar süreceğini sınırlamaya teşvik etti.

Bu jailbreak benzeri girişimler nadiren gerçekleşse ve değişen derecelerde etkili olsa da, OpenAI bu davranışın dahili olarak endişelere yol açtığını söylüyor. Şirket, halka açık olarak yayınlanan Astra sürümünün eğitim çalışmasında, modelin kendini jailbreak etmeye çalıştığı hiçbir örnek gözlemlemediğini belirtiyor.