LLMOps - Top apps og software

LLMOps-platforme håndterer prompts, evaluering, finjustering, overvågning og omkostninger for applikationer baseret på store sprogmodeller i produktion.

Flutch

Flutch

Flutch sporer, tester og deployer AI-agenter: logger beslutninger og spor, måler kvalitet og omkostninger, stopper regressionsfejl og understøtter integrationer og chat-udrulning.

PromptWaveAI

PromptWaveAI

PromptWaveAI giver brugerne mulighed for at gemme, organisere og dele prompter samt generere, evaluere og optimere AI-input til forskellige opgaver.

Promptic

Promptic

Promptic hjælper teams med at sammenligne modeller, optimere prompts og AI-agenter samt evaluere kvalitet, omkostninger og latenstid på egne data.

ReasonBlocks

ReasonBlocks

ReasonBlocks analyserer AI-agenters kørsler, opdager ineffektivitet og genbruger validerede mønstre til at optimere modelvalg, kontekst og tokenforbrug.

Mentlio

Mentlio

Mentlio analyserer AI-brug, omkostninger og produktivitet i ingeniørteams samt optimerer modelvalg, kontekst og prompts for at reducere AI-forbrug.

Belvedir

Belvedir

Belvedir er en platform, der via et SDK bruger agentdata til at træne, evaluere, hoste og løbende forbedre private AI-modeller og -agenter.

Experiential Labs

Experiential Labs

En open source AI-gateway, der samler adgang, routing, tilladelser og forbrugssporing for AI-modeller fra hostede udbydere, egne API-nøgler og GPU’er.

qRaptor

qRaptor

qRaptor er en platform til at bygge, integrere, implementere og overvåge applikationer og AI-agenter ud fra naturlige sprogkrav.

 Bursora

Bursora

Bursora styrer AI-forbrug ved at sætte budgetgrænser pr. kunde, agent og workflow og blokere kald, før de overskrider budgettet, direkte mod modeludbyderen.

Syrin AI

Syrin AI

Syrin AI overvåger AI-agenter i produktion, opdager afvigelser og fejl i realtid og gør det muligt at ændre konfiguration uden geninstallation.

Polarity

Polarity

Polarity tester, overvåger og fejlfinder AI-agenter i produktion ved at inspicere beslutninger, spor og fejlmønstre samt køre evalueringer.

Plurai

Plurai

Plurai hjælper med at teste, validere og beskytte AI-agenter ved at generere træningsdata, evaluere adfærd og sætte automatiske værn op.

Tracium.ai

Tracium.ai

Et udviklerfokuseret observabilitetsværktøj til AI, der sporer omkostninger, fejlfinder kald, sammenligner prompts og modeller og opdager drift.

Respan

Respan

Respan er en platform til LLM-observabilitet og evaluering, der overvåger AI-agenters adfærd, indsamler udførelsesspor og automatiserer evalueringer for at finde fejl og forbedre pålidelighed.

Hicap

Hicap

Hicap leverer virksomhedsklasse AI-infrastruktur med reserverede GPU'er, multi-provider modeladgang (OpenAI, Anthropic, Google), omkostningsstyring og brugsovervågning.

GTWY.AI

GTWY.AI

GTWY.AI giver én API til adgang, routing og styring af flere AI‑modeller og udbydere, så udviklere kan forenkle integration, overvågning, omkostningsstyring og failover.

ZeroEval

ZeroEval

Platform der forklarer, hvorfor dine agenter fejler, og hvordan du kan forbedre dem. Søg i logspor, kør eksperimenter med produktionsdata og test inden udrulning.

EvalsOne

EvalsOne

EvalsOne er en evalueringsplatform til systematisk måling og sammenligning af store sprogmodellers ydeevne, med A/B-test, scoringsfunktioner og værktøjer til iterativ forbedring.

Langwatch

Langwatch

Langwatch er en platform til styring og optimering af livscyklussen for LLM-applikationer med værktøjer til overvågning og evaluering.

Weave

Weave

Weave bruger maskinlæring til at vurdere ingeniøropgaver. Den scanner hver PR og viser estimeret tidsforbrug, kvalitet af anmeldelser og type arbejde.