AI-ügynökök benchmarkjait futtatja párhuzamosan, csapaton belül követi az eredményeket, és méri a pontszámokat, tokenhasználatot és késleltetést.

Ön ennek az alkalmazásnak a fejlesztője? Igazolja a tulajdonjogot, hogy kezelhesse ezt az adatlapot.

A BenchSpan egy **ügynök-benchmarking platform**, amelyet az AI-ügynököket fejlesztő fejlesztők számára terveztek, és lehetővé teszi a benchmarkok percek, nem pedig órák alatti teljesítését.[1] Párhuzamosan futtatja a kiértékeléseket izolált Docker-tárolókban, minimális beállítással támogatva az olyan munkaterheléseket, mint a 14 órás SWE-bench.[1] A felhasználók egy egyszerű bash szkriptet biztosítanak az ügynökük elindításához, és nincs szükség keretrendszer zárolására vagy speciális interfész-módosításokra.[1] A platform szabványos benchmarkok könyvtárát kínálja, beleértve a **SWE-bench Verified**, **SWE-bench Lite**, **Terminal-Bench**, **HumanEval**, **MBPP**, **MATH** és **GPQA**, illetve egyéni benchmarkokat is lehetővé tesz.[1] Konfigurálja a párhuzamos példányok számát, és indítsa el a futtatásokat közvetlenül az interfészről.[1] Az eredmények olyan részletes mutatókat rögzítenek, mint a pontszámok, a pályák, a tokenhasználat, a késleltetés és az egyéni adatok, mindezt egy kereshető csapatirányítópulton központosítva.[1] A futtatások commit hash címkével vannak ellátva a könnyű reprodukálhatóság és a verziók összehasonlítása érdekében.[1] Ez a beállítás leegyszerűsíti az **AI-ügynökértékelést**, a **összehasonlító munkafolyamatokat** és a teljesítménykövetést a mérnöki csapatok számára.[1][9]

Jogi nyilatkozat: A WebCatalog nem áll kapcsolatban a(z) BenchSpan vállalattal, nem társult vele, nincs általa felhatalmazva vagy jóváhagyva, és semmilyen módon nem kapcsolódik hozzá hivatalosan. Minden terméknév, logó és márkanév a megfelelő tulajdonosok tulajdona.