Jin10 verileri 3 Nisan, bu sabah 1'de, OpenAI yeni bir AI Agent değerlendirme Benchmark'ı - PaperBench'i açığa çıkardı. Bu Benchmark, akıllı ajanların arama, entegrasyon, yürütme gibi yeteneklerini değerlendiriyor ve 2024 Uluslararası Makine Öğrenimi Konferansı'ndaki en iyi makalelerin yeniden üretilmesini gerektiriyor; bu, makale içeriğini anlama, kod yazma ve deney yürütme gibi yetenekleri içeriyor. OpenAI'nin açıkladığı test verilerine göre, şu anda tanınmış büyük modellerle oluşturulan akıllı ajanlar, üst düzey makine öğrenimi uzmanı doktorlarını yenemiyor. Ancak, yardımcı öğrenme ve araştırma içeriğini anlama konusunda oldukça faydalı.
The content is for reference only, not a solicitation or offer. No investment, tax, or legal advice provided. See Disclaimer for more risks disclosure.
OpenAI Açık Kaynak PaperBench, üst düzey AI Agent değerlendirmesini yeniden şekillendiriyor
Jin10 verileri 3 Nisan, bu sabah 1'de, OpenAI yeni bir AI Agent değerlendirme Benchmark'ı - PaperBench'i açığa çıkardı. Bu Benchmark, akıllı ajanların arama, entegrasyon, yürütme gibi yeteneklerini değerlendiriyor ve 2024 Uluslararası Makine Öğrenimi Konferansı'ndaki en iyi makalelerin yeniden üretilmesini gerektiriyor; bu, makale içeriğini anlama, kod yazma ve deney yürütme gibi yetenekleri içeriyor. OpenAI'nin açıkladığı test verilerine göre, şu anda tanınmış büyük modellerle oluşturulan akıllı ajanlar, üst düzey makine öğrenimi uzmanı doktorlarını yenemiyor. Ancak, yardımcı öğrenme ve araştırma içeriğini anlama konusunda oldukça faydalı.