LLMOps - 人気のアプリとソフトウェア

LLMOpsプラットフォームは、本番環境で稼働する大規模言語モデルのアプリケーションについて、プロンプト、評価、ファインチューニング、モニタリング、コストを管理します。

Flutch

Flutch

FlutchはAIワークフローの可観測性と品質管理を提供する展開・テストプラットフォーム。実行のトレース、品質・コスト測定、受入テストやバージョン管理、チャットUIやサービスのデプロイを支援する。

PromptWaveAI

PromptWaveAI

PromptWaveAIは、プロンプトを保存、整理、共有できるアプリです。ユーザーは新しいプロンプトを生成し、改善できます。

Promptic

Promptic

Prompticは、独自データで生成AIのモデルやプロンプト、エージェントを比較・評価し、品質やコストに基づく改善を支援するプラットフォームです。

ReasonBlocks

ReasonBlocks

AIエージェントの実行履歴を分析し、推論やツール利用のパターン、ループ、コードベースの知識を活用して、モデル選択・コンテキスト・実行を最適化する基盤とPython SDKです。

Mentlio

Mentlio

Mentlioは、エンジニアリングチームのAI利用状況、コスト、生産性を可視化し、モデル選択やコンテキスト最適化、プロンプト圧縮でAI支出を削減する分析・最適化プラットフォームです。

Belvedir

Belvedir

Belvedirは、エージェントの実行履歴をSDKで収集し、カスタムAIモデルや評価・ルーティング機能を構築、展開、継続的に改善するためのプライベートAI基盤です。

Experiential Labs

Experiential Labs

Experiential Labsは、複数のAIモデルやプロバイダーを1つのAPIで接続・管理し、アクセス制御、ルーティング、利用状況、コストを一元管理するプラットフォームです。

qRaptor

qRaptor

自然言語の要件から、AIアプリやエージェント、ワークフローを作成・運用できる開発基盤。ツール連携、展開、監視、監査、セキュリティ管理に対応します。

 Bursora

Bursora

Bursoraは、OpenAIなどのAIモデル利用料金を顧客・エージェント・ワークフロー単位で管理し、送信前に予算超過のリクエストを許可・調整・ブロックする支出管理アプリです。

Syrin AI

Syrin AI

Syrin AIは、AIエージェントの本番環境での監視、デバッグ、ドリフト検出、追跡を行い、プロンプトや設定を遠隔で更新できる運用管理ツールです。

Polarity

Polarity

Polarityは、実稼働中のAIエージェントの意思決定を監視・評価し、失敗パターンの検出、トレース解析、再現デバッグ、アラート対応を行う可観測性プラットフォームです。

Plurai

Plurai

AIエージェントの信頼性を評価・検証・保護するプラットフォーム。合成テスト生成、リアルタイムのガードレール、ポリシー確認で障害や違反を検出し、本番運用を支援します。

Tracium.ai

Tracium.ai

Tracium.aiは、AIシステムのコスト追跡、リクエストのトレース、障害のデバッグ、プロンプトやモデルの比較、ドリフト検知を一元的に行う開発者向け観測ツールです。

Respan

Respan

Respanは、実稼働LLMの挙動を可視化・評価・改善するプラットフォームで、実行トレースやメタデータを収集し問題分析やプロンプト最適化を支援します。

Hicap

Hicap

Hicapは企業向けAIインフラで、OpenAI/Gemini/Anthropicのモデルを予約GPUで実稼働させ、コスト削減と使用状況の可視化を提供します。

GTWY.AI

GTWY.AI

GTWY.AIは複数の大規模言語モデルやAIプロバイダを単一のAPIで統合し、接続・認証・ルーティング・監視・フォールバックなどの運用を簡素化します。

ZeroEval

ZeroEval

エージェントの失敗原因を解析し改善案を提示するプラットフォーム。トレース検索、実運用データでの実験実行、出荷前のテストが可能。

EvalsOne

EvalsOne

EvalsOneは、大規模言語モデルのプロンプトを定量的に評価・比較し、メトリクスとA/Bテストで応答の精度と挙動を反復的に改善するツールです。

Langwatch

Langwatch

Langwatchは、言語モデルのライフサイクルを管理し、パフォーマンスの監視・改善を行うプラットフォームです。

Weave

Weave

Weaveは機械学習を用いてエンジニアリングを測定します。PRをスキャンし、各PRの所要時間、レビューの質、作業の種類を表示します。