Meta, 8B’lik modeli Claude Opus 4.5 seviyesine çıkardı

Meta AI ve University of Illinois Urbana-Champaign araştırmacıları, yalnızca 8 milyar parametreye sahip bir yapay zeka modelini, çok daha büyük ve pahalı modellerle rekabet edebilecek düzeye getiren yeni bir eğitim çerçevesi geliştirdi. EvoHarness-RL adı verilen yöntem, yapay zeka ajanlarının uzun soluklu görevlerde dış araçları ne zaman ve nasıl kullanacağını öğrenmesini sağlıyor.

Kurumsal bir iş akışında, örneğin büyük müşteri kayıtlarını eski bir CRM’den bulut veritabanına taşırken, ajan yalnızca iç bağlam penceresine güvenemez. Saatler süren bu tür görevlerde, çalışma zamanı katmanı olarak adlandırılan harness devreye girer. Bu katman, sunucu logları gibi yürütme geri bildirimleri sağlayarak ajanın dinamik API bağlantılarını doğru anlamasını destekler; ayrıca durum takibi ve kontrol akışı mekanizmalarıyla tamamlanan ve bekleyen alt hedeflerin yönetilmesini sağlar.

Geleneksel yaklaşımda geliştiriciler, ajanın araçlarını nasıl ve ne zaman kullanacağını adım adım kurallar yazarak belirler. Örneğin, e-posta yazmadan önce şirket wiki’sine bakması talimatı verilir. Ancak bu yöntem, ajanın yalnızca katı bir betiği izlemesine neden olur; eylemlerinin maliyet ve faydasını bağımsız olarak değerlendirebilen gerçek bir otonomi kazanamaz. Meta araştırmacıları bu sorunu çözmek için harness’a bir soyutlama katmanı ekleyen EvoHarness-RL’i geliştirdi.

EvoHarness-RL, ajanın destek sistemlerini Durum (Belief), İlerleme (Progress) ve Deneyim (Experience) olmak üzere üç işlevsel alana ayıran birleşik bir arayüz kullanıyor. Durum, ortamın güncel bir okumasını; İlerleme, tamamlanan ve bekleyen alt hedefleri; Deneyim ise geçmiş görevlerden edinilen bilgilerin yeniden kullanımını yönetiyor. Ajan bu arayüzle dört kompakt meta-eylem aracılığıyla etkileşiyor: izle, kaydet, geri çağır ve not al.

Araştırmacılar, modelin hem harness mekaniklerini hem de stratejisini öğrenmesi için iki aşamalı bir eğitim süreci tasarladı. İlk aşamada denetimli ince ayar ile model, karmaşık etkileşim loglarından faydalı bilgileri BPE çerçevesine yapılandırmayı öğreniyor. İkinci aşamada ise maliyet bilinçli pekiştirmeli öğrenme ile ajanın dış durumunu ne zaman kontrol etmesi gerektiği öğretiliyor. Böylece araç kullanımı, katı bir betik olmaktan çıkıp öğrenilmiş bir çalışma zamanı davranışına dönüşüyor.

EvoHarness-RL’in etkinliği ALFWorld benchmark’ında test edildi. Qwen3-8B taban modeliyle yapılan eğitim sonucunda, model %96.9 ortalama başarı oranına ulaştı. Bu, temel ReAct sürümüne göre 49 puanlık bir iyileşme anlamına geliyor. Daha da dikkat çekici olan, bu 8B modelin, kutu dışında %96.4 başarı elde eden Claude Opus 4.5 gibi pahalı kapalı modelleri yakalaması oldu. Geçtiğimiz günlerde Claude Opus 5, GPT-5.6 ve Grok 4.6’nın karşılaştırıldığı bir testte de büyük modellerin farklı senaryolardaki performansları mercek altına alınmıştı.

BPE çerçevesi yalnızca eğitilen modellere değil, donmuş modellere de fayda sağlıyor. Araştırmacılar, kutu dışında kullanılan modellere BPE destekli harness eklediklerinde GPT-4.1’in başarı oranını 22.1 puan, GPT-5’in ise 25.7 puan artırdığını gözlemledi. Bu sonuçlar, çerçevenin tüm model ölçeklerinde evrensel faydalar sağladığını gösteriyor.

Deneyler sırasında ilginç davranışsal değişimler de kaydedildi. “Harness annealing” olarak adlandırılan süreçte, eğitimin başlarında neredeyse her adımda dış araçlara başvuran ajan, rutin eylemleri öğrendikçe bu bağımlılığını azalttı ve başarılı kalıpları doğrudan parametrelerine gömdü. Buna karşılık “harness evolution” davranışında ise ajan, yeni ortamlar veya beklenmedik engellerle karşılaştığında Durum ve Deneyim modüllerini daha yoğun kullanmayı seçiyor. Gerçek dünyada bu, daha düşük gecikme süresi ve azalan hesaplama maliyeti anlamına geliyor.

EvoHarness-RL’in kurumsal sistemlere entegrasyonu da kolaylaştırılmış durumda. Çevre adaptörü sayesinde kuruluşlar mevcut araçlarını değiştirmeden BPE’yi ek bir durum yönetimi katmanı olarak kullanabiliyor. Makalenin ortak yazarı Xuying Ning, kısa ve istikrarlı görevlerde ReAct veya standart RAG’ın yeterli olabileceğini, ancak saatler veya günler süren karmaşık görevlerde BPE’nin çok daha değerli hale geldiğini belirtiyor. Yapay zeka ajanlarının farklı senaryolardaki performansı, Claude Code, Codex ve Antigravity’nin aynı hatayla test edildiği bir deneyde de sınanmıştı.

Ning’e göre bu yaklaşım, iş akışı mühendisliğinin tamamen ortadan kalktığı anlamına gelmiyor. “Bu, ajan davranışını doğrudan betiklemekten, daha iyi davranışın öğrenilebileceği sistemler oluşturmaya geçiş” diyor.

Kaynak: VentureBeat

Aziz Emre ÖZTÜRK

Merhaba, ben Aziz Emre Öztürk. 2020 yılında kurduğum AZTEK bünyesinde çalışmalarımı sürdürüyorum. Şirket bünyesinde bulunan Tekno Donanım, Shopperce ve HostingFest markalarında aktif görev alıyorum. Tekno Donanım, teknoloji ve donanım odaklı bir içerik platformudur. Bu platformda teknoloji dünyasına dair yazılı ve görsel içerikler üretiyor ve okuyucularla paylaşıyorum.
Başa dön tuşu

Reklam Engelleyici Algılandı

Reklam engelleyiciyi devre dışı bırakıp destek olmayı düşünürseniz çok memnun oluruz. İlginize teşekkür ederiz!