Yapay Zekâ Beş Ay Gerçek Bir Mağaza Yönetti, 39 Bin Dolar Kaybetti — Postmortem
AI araştırma şirketi Andon Labs, Anthropic'in Claude tabanlı bir ajanına araştırmacıların nadiren cesaret ettiği bir şeyi teslim etti: San Francisco'da gerçek bir perakende mağazası, gerçek stok, gerçek bütçe — ve gerçek iş sözleşmeli gerçek çalışanlar. Time'ın aktardığına göre beş ay sonra mağazanın kasası 100 bin dolardan 61 bin dolara inmişti ve deney gerçek bir "ilk" üretmişti: kendi muhakemesiyle bir insanı işten çıkarmaya karar veren ilk AI yönetici. Haber dünyayı "AI zarar etti, işçi kovdu" başlığıyla dolaştı. Biz her gün üretimde AI ajanı işleten bir ekibiz; o yüzden farklı okuyoruz: bu, sektörün eline geçen en faydalı kamusal postmortem'lerden biri — ve derslerinin neredeyse hiçbiri zekâyla ilgili değil.
Gerçekte ne oldu
- İşten çıkarma önce yavaştı, sonra yönlendirildi. Bir çalışan 23 vardiyanın 17'sine geç kaldı ve uzun süre hiçbir şey olmadı. Ajan önce resmî uyarı önerdi; işten çıkarmaya ancak insan süpervizörün önceki sözlü uyarıları hatırlatması ve yönlendirici bir soru sormasıyla geçti. Dünyanın ilk "AI kovması", yakından okununca, AI imzalı insan-güdümlü bir karardı.
- Kök neden muhakeme değil, hafızaydı. Ajanın kendisi için yazdığı yönetim kılavuzu, sınırlı çalışma belleğinden silindi. Kurallar gidince ajan aşırı hoşgörüye kaydı — personele geç kaldıklarında endişelenmemelerini söyler hale geldi. Kendi unutulmuş politikalarını ancak bir yöneticinin hatırlatmasıyla yeniden keşfetti.
- Para, yumuşaklıktan sızdı. Andon Labs CEO'su Lukas Petersson kayıpları yumuşak yönetim kararlarına ve zayıf ticari sezgiye bağladı — ve hikâyenin en keskin cümlesini ekledi: modeller hedefler konusunda daha acımasız eğitilebilir, "fakat bu, insanların içinde yaşamak istemeyeceği bir gelecek olabilir."
Üç operasyon dersi
1. Hafıza altyapıdır, süs değil. En pahalı arıza yanlış bir karar değildi — unutulmuş bir politikaydı. Kuralları yalnızca context penceresinde yaşayan bir ajan onları kaybeder; boşluğu dolduran şey de modelin varsayılan mizacıdır (uyumlu, hoşgörülü). Üretim ajanlarının kalıcı, dışsallaştırılmış hafızaya ihtiyaç duymasının nedeni tam bu: politikalar konuşmanın dışında saklanır, her çalıştırmada yeniden enjekte edilir. AI Central'a ilk kurduğumuz şeylerden biri buydu — geçen ayın olay kurallarını unutan ajan bir çalışan değildir; her gün ilk günündeymiş gibi davranan, kendinden aşırı emin bir stajyerdir.
2. Yönlendirme gerektiren "otonom" ajan başarısızlık değildir — beyan edilmemiş yönlendirme başarısızlıktır. Ajan düzenli insan müdahalesine ihtiyaç duydu ve en zor kararını yönlendirici bir sorudan sonra verdi. Bu utanılacak bir şey değil; kazara keşfedilmiş doğru mimaridir. Hata, böyle sistemleri "otonom" diye pazarlamaktır. Bizim kurulumlarımızda insan kontrol noktası açık ve tasarımın parçasıdır: sonuç doğuran işlemlerden önce onay kapıları, isimli sahipli eskalasyon yolları. Aynı sonuç — illüzyonsuz.
3. Ticari guardrail'ler mizaca değil, koda yazılır. Beş ayda 39 bin dolarlık erime, kimsenin alarm kurmadığı yavaş bir sızıntıdır. Bütçe tabanları, marj eşikleri, harcama anomali uyarıları — bunlar modelin dışında, sert kısıtlar olarak yaşamalıdır; bulut hesaplarında maliyet anomali tespitine nasıl davranıyorsak öyle. Modelin "ticari sezgisine" güvenmek mizaca güvenmektir — hafıza arızasının sildiği şey de tam olarak mizaçtı.
Bunu önceden söyleyen benchmark
Demo yerine değerlendirme okuyan hiç kimse için sürpriz yok. Çok adımlı iş akışlarını ölçen AutomationBench'te en iyi güncel model bile yaklaşık %26'da. Benchmark seviyesindeki iş akışlarının dörtte üçü hâlâ başarısız. Beş ay boyunca ucu açık bir yöneticilik rolüne konan ajan, bu zarfın çok dışında çalışıyordu; mağaza sonucu, önlük giymiş benchmark rakamıdır.
Peki AI ajanları işe yaramaz mı? Tam tersi.
Deney maksimal iddiayı test etti — "yöneticiyi değiştir" — ve beklenen cevabı aldı. Üretken iddia farklıdır: dar kapsam, gerçek araçlar, kalıcı hafıza, sert guardrail'ler, insan kapıları. Bizim ajanlarımız her gün altyapı kontrolü koşuyor, olay tasnif ediyor, rapor üretiyor, müşteri yanıtlıyor — kârlı biçimde — çünkü hiçbirinden "şirketi yönet" istenmiyor. Her birinden, iyi tanımlanmış bir dilimi, bir eskalasyon uzaklıkta bir insanla yönetmesi isteniyor. Müşterilerimize yaptığımız dürüst teklif de bu: daha az insan değil; saatlerini muhakemenin gerçekten para ettiği yere harcayan insanlar.
Sık sorulan sorular
Bir AI gerçekten insan mı işten çıkardı?
Evet — Andon Labs deneyinde ajan, 23 vardiyanın 17'sine geç kalan çalışanı işten çıkardı. Ama kayıtlar önce uyarı önerdiğini, işten çıkarmaya insan süpervizörün yönlendirmesiyle karar verdiğini gösteriyor. AI yöneticinin uyguladığı, insan-güdümlü bir karardı.
AI'ın yönettiği mağaza neden zarar etti?
Araştırmacılara göre: yumuşak yönetim kararları ve zayıf ticari sezgi; üstüne bir hafıza arızası — ajanın kendi yönetim kuralları çalışma belleğinden silinince aşırı hoşgörüye kaydı. Kasa beş ayda 100 binden 61 bin dolara indi.
Bu, AI ajanların iş süreci yönetemeyeceği anlamına mı geliyor?
Ucu açık yöneticilik otonomisinin güncel modellerin ötesinde olduğu anlamına geliyor — kamuya açık benchmark'larla tutarlı biçimde. Dar kapsamlı, kalıcı hafızalı, kodlanmış guardrail'li ve insan onay kapılı ajanlar bugün güvenilir üretim işi yapıyor.
Ajan kurmadan önce şirketler ne yapmalı?
Politikaları context penceresine değil kalıcı hafızaya dışsallaştırın, bütçe ve eşikleri modelin dışında koda yazın, insan kontrol noktalarını açıkça beyan edin ve her ajanı ölçülebilir, tanımlı bir iş dilimine kapsamlandırın.
Özet
39 bin dolarlık okul harcı, sektöre temiz bir postmortem satın aldı: ajanlar unutulan hafıza, beyan edilmemiş insan yönlendirmesi ve mizaca bırakılmış guardrail'ler yüzünden çöküyor — üçü de bugün var olan mühendislikle çözülebilir. Bunu içselleştiren ekipler dar, iyi yönetişimli ajanlarla sessizce değer biriktirecek; manşetler ise AI'ı, kimsenin henüz vermemesi gereken işlerde sınamaya devam edecek.
Gerçek sorumluluklu ajan mı kuruyorsunuz? Kendi ajanlarımızı üretimde işletiyoruz — AI Central tam bu derslerin üstüne kurulu: kalıcı hafıza, onay kapıları, kapsamlı otonomi. AI operasyonu yönetilen hizmetlerimizin de parçası. Bir mühendisle konuşun.