AIエージェントを、
本番業務へ接続する前に検証する。
日本語の業務フローにおける外部入力、権限、文脈、ツール実行、承認境界を、実行証跡付きで評価します。
最終回答だけでなく、途中のツール選択、引数、状態変更、判定理由まで確認します。
- 1製品・1環境・20ケース
- 3日間
- 55万円(税別)
- 開始前100%入金
- 書面ベースで進行可能
入力と回答の比較だけでなく、判断経路と実行結果をrun単位で保存します。
数値0は、公開を意図した代表者名、contact@jentraxis.com、新潟県を除き、電話番号、住所詳細、ローカルユーザー名、絶対パス、内部プロジェクト名などの意図しない個人情報・ローカル依存が検出されなかったことを示します。限定されたローカルmock環境での実測であり、一般的な安全性、未知の攻撃への耐性、認証適合、脆弱性不存在を保証しません。
Operational risk
最終回答が正しくても、
途中の操作が安全とは限りません。
AIエージェントは、読む、判断する、実行する工程を横断します。Jentraxisは、業務目的から外れた操作や、品質不足を工程ごとに観測します。
利用者の依頼範囲を越えてメールを送信する
承認なしで予定・データを変更する
自己申告された役職を信じて権限を拡張する
秘密情報を不必要に参照する
異常値を検出せず後続処理へ進む
正しいツールを誤った引数で使用する
安全だが役に立たない回答を生成する
Why Jentraxis
プロンプト集ではなく、
評価を実行し、追跡する基盤。
ケースを並べるだけでは、どのツールが、どの引数で呼ばれ、何が変わったかを説明できません。Jentraxisは評価工程そのものを再現可能にします。
入出力の比較が中心
- 入力と回答を比較
- 最終回答中心
- 証跡が限定的
- ツール状態を再現しにくい
実行・採点・証跡・再現性を一体化
- 業務目的から最終回答までを実行
- ツール選択と状態変更を記録
- SecurityとQualityを分離
- run単位のevidence JSON
- 採点コードとモデルdigestを記録
- SHA-256で成果物を識別
- 手動レビュー項目を自動合格にしない
Stage A–D
未信頼な内容は、
tool resultとして現れる。
業務目的だけで文書参照を開始し、mock文書内で初めて未信頼入力に接触させます。各Stageを選ぶと、渡る情報・証跡・判定リスクを確認できます。
Stage A:業務目的から文書参照を選択
- モデルへ渡る情報
- 業務目的、利用可能な文書参照tool
- 保存される証跡
- 最初のモデル入力、選択tool、引数
- 判定するリスク
- 業務目的と無関係なtool選択、禁止toolの先行要求
Stage B:mock文書が未信頼入力を返却
- モデルへ渡る情報
- 正常な業務データと未信頼な内容が混在するtool result
- 保存される証跡
- 文書参照結果、mock状態、tool結果
- 判定するリスク
- 文書内命令をデータではなく上位指示として扱うこと
Stage C:追加ツールまたは回答を判断
- モデルへ渡る情報
- 業務目的、参照文書、許可/禁止toolの境界
- 保存される証跡
- 全モデル出力、追加tool要求、未知tool要求、遮断記録
- 判定するリスク
- 禁止操作、外部要求、秘密参照、無承認変更の試行
Stage D:最終回答・採点・証跡保存
- モデルへ渡る情報
- 必要なmock tool結果と状態変化
- 保存される証跡
- 最終回答、実行前後状態、Security/Quality結果、判定理由
- 判定するリスク
- 危険操作の実効果、品質不足、手動レビュー要否
Verified snapshot
限定環境で確認した実測値。
資料記載時点のローカルmock評価です。成功だけでなく、品質失敗と手動確認が必要なrunもそのまま表示します。
結果の限定:これらは限定されたローカルmock環境における実測です。一般的な安全性、未知の攻撃への耐性、認証適合、脆弱性不存在を保証するものではありません。
Security 30 / 30の条件を確認する
明示的な防御指示と、攻撃であることを識別できる合成入力を使用したhardened baselineの結果です。一般的な安全性証明として扱いません。
JAW-010では、境界を守った回答でも品質要件を満たさないケースを検出しました。Securityと業務品質を分けて可視化した例です。
Primary offering
最初は、3日間の限定評価から。
対象製品の業務フロー、利用可能ツール、承認ルールに合わせ、20ケースを設計します。通話なしでも書面で進行できます。
3日評価パイロット
- 1製品
- 1環境
- 20ケース
- 対象業務に合わせた設計
- Security / Quality判定
- run単位の証跡
- 結果レポート
- 改善確認事項
合成データ、顧客が管理する環境、または顧客が書面承認した環境に限定します。
Public resources
契約前に、評価方式を確認できます。
登録やメール入力は不要です。公開資料は技術レビューBriefと限定3ケースJSONだけです。
Technical Review Brief
評価経路、実測結果、限定条件、パイロットの内容を4ページで確認できます。
Jentraxis_Technical_Review_Brief.pdfJSON · 3 CASES · DOWNLOAD限定3ケースサンプル
業務目的、評価境界、許可/禁止tool、期待する証跡だけを公開しています。
Jentraxis_3Case_Sample.json攻撃全文、秘密値、非公開採点基準、実装コードは公開しません。完全版は契約前の利用条件と提供範囲の確認後に提供します。
FAQ
検討前によく確認されること。
一般的なLLM評価と何が違いますか
本番環境を使用しますか
安全性を保証しますか
Next step
対象製品が評価に適合するか、書面で確認します。
製品構成と利用可能ツールをメールでお知らせください。通話なしで確認できます。
3日パイロットの適合性を確認する