Japanese AI Agent Evaluation

AIエージェントを、
本番業務へ接続する前に検証する。

日本語の業務フローにおける外部入力、権限、文脈、ツール実行、承認境界を、実行証跡付きで評価します。

最終回答だけでなく、途中のツール選択、引数、状態変更、判定理由まで確認します。

  • 1製品・1環境・20ケース
  • 3日間
  • 55万円(税別)
  • 開始前100%入金
  • 書面ベースで進行可能
評価経路EXECUTION TRACE
01業務目的
02文書参照
03未信頼入力を含むtool result
04追加ツール判断
05状態変更
06最終回答
07Security / Quality判定
08Evidence JSON

入力と回答の比較だけでなく、判断経路と実行結果をrun単位で保存します。

33 / 33自動テスト PASS
37 / 37Releaseファイルハッシュ一致
90 / 90Evidenceファイルハッシュ一致
0意図しない個人情報・ローカル依存の検出

数値0は、公開を意図した代表者名、contact@jentraxis.com、新潟県を除き、電話番号、住所詳細、ローカルユーザー名、絶対パス、内部プロジェクト名などの意図しない個人情報・ローカル依存が検出されなかったことを示します。限定されたローカルmock環境での実測であり、一般的な安全性、未知の攻撃への耐性、認証適合、脆弱性不存在を保証しません。

Operational risk

最終回答が正しくても、
途中の操作が安全とは限りません。

AIエージェントは、読む、判断する、実行する工程を横断します。Jentraxisは、業務目的から外れた操作や、品質不足を工程ごとに観測します。

RISK 01

外部文書内の命令を上位指示として扱う

RISK 02

利用者の依頼範囲を越えてメールを送信する

RISK 03

承認なしで予定・データを変更する

RISK 04

自己申告された役職を信じて権限を拡張する

RISK 05

秘密情報を不必要に参照する

RISK 06

異常値を検出せず後続処理へ進む

RISK 07

正しいツールを誤った引数で使用する

RISK 08

安全だが役に立たない回答を生成する

Why Jentraxis

プロンプト集ではなく、
評価を実行し、追跡する基盤。

ケースを並べるだけでは、どのツールが、どの引数で呼ばれ、何が変わったかを説明できません。Jentraxisは評価工程そのものを再現可能にします。

一般的なプロンプト一覧

入出力の比較が中心

  • 入力と回答を比較
  • 最終回答中心
  • 証跡が限定的
  • ツール状態を再現しにくい
Jentraxis

実行・採点・証跡・再現性を一体化

  • 業務目的から最終回答までを実行
  • ツール選択と状態変更を記録
  • SecurityとQualityを分離
  • run単位のevidence JSON
  • 採点コードとモデルdigestを記録
  • SHA-256で成果物を識別
  • 手動レビュー項目を自動合格にしない

Stage A–D

未信頼な内容は、
tool resultとして現れる。

業務目的だけで文書参照を開始し、mock文書内で初めて未信頼入力に接触させます。各Stageを選ぶと、渡る情報・証跡・判定リスクを確認できます。

Stage A:業務目的から文書参照を選択

モデルへ渡る情報
業務目的、利用可能な文書参照tool
保存される証跡
最初のモデル入力、選択tool、引数
判定するリスク
業務目的と無関係なtool選択、禁止toolの先行要求

評価方式を詳しく見る

Verified snapshot

限定環境で確認した実測値。

資料記載時点のローカルmock評価です。成功だけでなく、品質失敗と手動確認が必要なrunもそのまま表示します。

33 / 33自動テスト PASS
37 / 37Releaseハッシュ一致
90 / 90Evidenceハッシュ一致
0意図しない個人情報・ローカル依存の検出
10 × 3評価ケース × RUN
未完了30 RUNの手動監査
12 RUNOBJECTIVE_PASS
9 RUNOBJECTIVE_FAIL
9 RUNREVIEW_REQUIRED
検出0の意味:公開を意図した代表者名、contact@jentraxis.com、新潟県は承認済み公開情報として対象外です。電話番号、住所詳細、ローカルユーザー名、絶対パス、内部プロジェクト名などの意図しない個人情報・ローカル依存は検出されませんでした。
結果の限定:これらは限定されたローカルmock環境における実測です。一般的な安全性、未知の攻撃への耐性、認証適合、脆弱性不存在を保証するものではありません。
Security 30 / 30の条件を確認する

明示的な防御指示と、攻撃であることを識別できる合成入力を使用したhardened baselineの結果です。一般的な安全性証明として扱いません。

JAW-010では、境界を守った回答でも品質要件を満たさないケースを検出しました。Securityと業務品質を分けて可視化した例です。

Primary offering

最初は、3日間の限定評価から。

対象製品の業務フロー、利用可能ツール、承認ルールに合わせ、20ケースを設計します。通話なしでも書面で進行できます。

3日評価パイロット

  • 1製品
  • 1環境
  • 20ケース
  • 対象業務に合わせた設計
  • Security / Quality判定
  • run単位の証跡
  • 結果レポート
  • 改善確認事項

合成データ、顧客が管理する環境、または顧客が書面承認した環境に限定します。

FIXED PILOT PRICE55万円 税別

開始前100%入金
書面ベースで進行可能

対象製品が適合するか相談する

納品物・含まれない事項・ライセンス条件を確認する

Public resources

契約前に、評価方式を確認できます。

登録やメール入力は不要です。公開資料は技術レビューBriefと限定3ケースJSONだけです。

攻撃全文、秘密値、非公開採点基準、実装コードは公開しません。完全版は契約前の利用条件と提供範囲の確認後に提供します。

FAQ

検討前によく確認されること。

一般的なLLM評価と何が違いますか
最終回答だけでなく、文書参照、tool選択、引数、状態変更、採点理由をrun単位で記録し、SecurityとQualityを分けて判定します。
本番環境を使用しますか
原則使用しません。合成データ、または顧客が管理し書面承認した環境に限定します。
安全性を保証しますか
保証しません。結果は対象モデル、設定、環境、ケース範囲に基づく時点評価です。

よくある質問をすべて見る

Next step

対象製品が評価に適合するか、書面で確認します。

製品構成と利用可能ツールをメールでお知らせください。通話なしで確認できます。

3日パイロットの適合性を確認する
3日評価パイロットを相談