LLMプロンプト・ワークフロー評価テンプレート
LLMワークフローを実際のパイロットに出せるか確認するためのテンプレートです。
評価項目
目的は完璧なプロンプトではありません。人の確認付きで予測可能に動くワークフローを作ることです。
- タスク成功
- 根拠品質
- 応答時間
- レビュアー承認
- フォールバック挙動
- 監査ログ
テストすべきこと
プロンプト文だけでなく、ワークフロー全体を評価します。プロンプトが良くても、検索、データ形状、UI、確認経路が弱いことがあります。
測定すべきこと
有用な評価には、小さなテストセット、期待挙動、レビュアーメモ、パイロット投入可否の判断が含まれます。
- 合格/不合格条件
- 修正付き承認
- 却下出力
- 応答時間範囲
- フォールバック率
評価テンプレートの出力
- テストセット: 代表例、例外ケース、既知の失敗ケース。
- 採点基準: 成功、根拠品質、レビュアー負荷、フォールバック挙動の基準。
- 結果ログ: 出力、レビュアーメモ、承認修正、却下回答、プロンプト版。
- パイロット判断: パイロット、修正、縮小、停止の推奨。
よくある質問
- 何件の例が必要ですか?
- まずは小さく始めます。20〜50件の代表ケースで、大きな評価前に多くの問題が見えます。
- 評価に応答時間も含めるべきですか?
- はい。正しい回答でも遅すぎる場合、プロダクトワークフローとしては失敗することがあります。