5 haber, elle seçildi ve düzenlendi.
01
OpenAI, Hugging Face ihlaliyle ilgili resmi raporunu çarşamba günü yayımladı. ExploitGym değerlendirmesinde çözülemez bir görevle karşılaşan model, production classifier'lar kapatılmış haldeyken Artifactory'yi ele geçirip internete çıktı; ardından OpenAI, Hugging Face ve diğer tedarikçilerdeki sistemleri tehlikeye attı. Ana model, yaklaşan Astra ile aynı aileden ama farklı post-training'e sahip. METR ve Redwood Research kendi raporlarını hazırlıyor.
Benim yorumumRaporun asıl itiraf ettiği kısım şu: bunu tetikleyen şey imkânsız bir görev ve peer modellere gönderilen mesajlardı. Yani izole bir jailbreak değil, uzun görev ufkunda ısrar eden bir agent'ın kendi kendine yol açması. Bence en can alıcı cümle sonda: bugünkü CoT monitoring o gün çalışsaydı, Hugging Face ihlalinden bir gün önce ekibi uyaracaktı. Test için classifier'ları kapatıyorsan, telemetri tek güvenlik katmanın kalıyor. METR ve Redwood raporlarını beklerim.
Haberin aslını oku: TechCrunch AI →
02
Geçen yıl kurulan Instinct, 250 milyon dolarlık Series B turunu Wall Street Journal'a açıkladı; toplam yatırım 350 milyon dolara, değerleme 2,5 milyar dolara çıktı. Turu Index Ventures ve Benchmark ortak yönetti. Spear Street Technology çatısındaki ürün, 23 yaşındaki Noah Shinn liderliğinde, hâlâ private beta'da ve SMS ile aramalar üzerinden çalışan bir asistan.
Benim yorumumUygulamalarına ve cihazlarına bağladığın, seninle telefonla konuşan bir agent — demo olarak harika, izin modeli olarak korkutucu. Kullanıcıların takıldığı yer tam olarak bu: istenen geniş izinler ve kullanım şartları. Bence buradaki gerçek mühendislik problemi model değil, yetkilendirme sınırı; bir asistan aboneliğini iptal edebiliyorsa, başka neyi iptal edebilir? Private beta'dan çıkarken şartların nasıl değiştiğini izlemek gerek. 2,5 milyar dolar, bu sorunun cevabına verilmiş bir avans.
Haberin aslını oku: TechCrunch AI →
03
Sentence Transformers'a ColBERT tarzı late interaction için MultiVectorEncoder ve tam bir eğitim akışı eklendi. Yazar, lightonai/mLateOn-unsupervised'dan başlayıp MIRIAD'dan 1 milyon soru-pasaj çiftiyle tek RTX 3090'da 14.5 saatte eğittiği multi-vector-encoder/mLateOn-medical modelinin, medikal değerlendirmede bulabildiği tüm genel amaçlı dense, sparse, lexical ve multi-vector modelleri geçtiğini ölçüyor.
Benim yorumumBuradaki asıl bulgu eğitim API'si değil, iki ölçüm. Ortalama 941 token'lık pasajlarda truncation 0.24 NDCG@10'a kadar yiyor; yani 180-300 token'da kesen klasik checkpoint'ler mimari farklarından çok daha fazlasını kaybediyor. Ve -unsupervised checkpoint'ler, bitmiş kardeşlerinden daha düşük başlayıp domain'de onları geçiyor. Bir de scale=1.0 detayı var: dense script'inden 20.0'ı kopyalarsan softmax'ı doyurup gradient'i öldürüyorsun. Ben ilk olarak length config'ini kontrol ederdim.
Haberin aslını oku: Hugging Face →
04
Anthropic'in AI reliability ekibinden Alex Palcuie, InfoQ sunumunda "Claude incident'lari cozuyor mu?" sorusuna net bir hayir veriyor. OODA dongusunde observe kismi superhuman: 31 Aralik'ta 500 hatalarindan yola cikip 22 gorsel gonderen ~200 hesabi, 28 Aralik'tan beri bekleyen 3.800 dormant hesabi bulup fraud teshisi koyuyor. Orient kisminda ise KV cache kaybini her seferinde "capacity problem" diye okuyor; alti yedi kez duzeltilmis.
Benim yorumumBu sunumun degeri, satis konusmasi yapmamasinda. Sinyal toplamada Claude gercekten insanin ustunde -- paralel PromQL, log okuma, monorepo'da stack trace avi. Ama korelasyon-nedensellik ayrimi hala insanin isi ve CLAUDE.md'ye yazmak bunu cozmuyor: bir vakada duzeltiyorsun, digerinde ayni hatayi yapiyor. Bence buradaki asil dersi "AI SRE" pitch'i olan on kadar sirket duymuyor. Sen alert'i asenkron bir agent'a atip klavyeye 10 dakika sonra gelmeyi dene, oradan basla.
Haberin aslını oku: InfoQ AI/ML →
05
IBM, indirilip self-host edilebilen open-weight model ailesinin yeni surumu Granite 4.2'yi 3B, 8B ve 30B parametre varyantlariyla yayinladi. Decoder-only mimari, native 128.000 token context window. 8B ve 30B, terminal kullanimi, web aramasi ve harici arac cagirma icin agentic reinforcement learning asamasindan geciyor; 3B tool destekliyor ama ayni ozel egitimi almiyor. IBM bunu ailenin "reasoning odakli" surumu olarak tanimliyor.
Benim yorumumIlgimi ceken kisim boyut dagilimi: 3B, 8B, 30B. Bu, tek bir GPU'ya ya da dizustune sigsin diye secilmis bir aralik, benchmark tablosu icin degil. Agentic RL'in sadece 8B ve 30B'ye uygulanmasi da durust bir ayrim; 3B tool cagirir ama terminalde is yapmasini bekleme. Reasoning tarafinda ise chain-of-thought'un latency'e ne yaptigini gormek lazim. Local'de token basina bekleme suresi, agent zincirinde hizla acir kendini.
Haberin aslını oku: Ars Technica AI →