なぜ重要か
従来は、スケジュール実行やCI/CDの評価が変更されたライブバージョンや、将来更新される判定基準を参照し、過去との比較条件が変わる可能性がありました。今回の機能により、評価対象と判定ロジックを明示的に固定し、評価結果の再現性を管理できます。長いトレースでは、v3の大きなコンテキストウィンドウにより、コンテキスト超過の可能性を抑えられます。
対象となるチーム
- Cortex Agentの開発・運用チーム
- AI評価基盤および品質保証チーム
- CI/CD・MLOps担当者
- Snowflake管理者・observability担当者
提供条件
- 提供ステータス: General availability
- 対象: Cortex AgentおよびCortex Analyst evaluations
- SnowsightおよびCortex Codeからagent versionを選択可能
- エディション、リージョン、必要な権限の詳細はリリースノートに記載なし
ユースケース
- CI/CDで特定のagent versionを評価対象に固定し、エージェント更新前後の品質差分を同じ条件で比較する。
- スケジュール評価でライブ設定の変更を避け、リリース時点の評価結果を再現可能な形で保存する。
- Anthropicモデルを許可しないアカウントで、system metricのv2またはv3によりGPT judgeを利用する。
- 長いAgent traceを評価する際にv3を指定し、claude-sonnet-4-6またはopenai-gpt-5.4の大きなコンテキストウィンドウを使用する。
- カスタムメトリクスごとにmodelを指定し、使用するLLM judgeを明示的に管理する。
仕組みと使い方
評価YAMLのagent_paramsブロックにagent_versionを指定し、system metricにはversionを指定します。カスタムメトリクスではmodelを指定してLLM judgeを固定します。以下は本文のキーに基づく概念例です。実際のYAML構造、利用可能なバージョン値、メトリクス定義は公式ドキュメントで確認してください。
agent_params:
agent_version: <agent-version-or-alias-or-shortcut>
metrics:
- name: answer_correctness
version: v3
- name: sql_correctness
version: v3
custom_metrics:
- name: <custom-metric>
model: <judge-model>
Snowsightではドロップダウンからバージョンを選択でき、Cortex Codeからも指定できます。versionを省略したsystem metricは現在v1を使用しますが、v1が非推奨になると後続バージョンへ移行します。custom metricのmodelを省略した場合は、現在claude-4-sonnetが使われ、非推奨時には後続モデルへ移行します。
導入ステップ
- 評価対象のCortex Agentについて、固定したい具体的なagent version、alias、shortcutを確認する。
- 評価YAMLのagent_paramsにagent_versionを追加し、対象エージェントを明示する。
- 使用するsystem metricごとにversionを指定し、判定モデルと評価基準を固定する。
- カスタムメトリクスを使う場合はmodelを指定し、LLM judgeの変更を管理する。
- SnowsightまたはCortex Codeで評価を実行し、結果と設定をCI/CDまたは評価履歴に保存する。
- observabilityのthread listおよびtrace viewで、ターンごとのagent versionを確認する。
運用上の注意
- system metricのversionを省略するとv1が使われ、v1の非推奨後は後続バージョンへ移行するため、長期比較ではversionを明示してください。
- custom metricのmodelを省略するとclaude-4-sonnetが使われ、モデル非推奨時に自動的に後続モデルへ移行します。
- aliasやshortcutを評価対象にする場合の解決・更新動作の詳細は、評価の再現性要件と照らして公式ドキュメントで確認してください。
- v2およびv3のGPT judge利用可否は、Anthropicモデルを許可しないアカウントへの対応として記載されています。
制約事項
- エディション別の提供条件、リージョン制限、必要権限はリリースノートに記載なし。
- agent_versionおよびsystem metric versionで指定可能な具体的な値やYAMLの完全なスキーマは、リリースノートに記載なし。
- リリースノートには、評価を実行するためのSQLコマンドやAPI呼び出し例は記載なし。
- v3のコンテキストウィンドウはclaude-sonnet-4-6で1Mトークン、openai-gpt-5.4で1.05Mトークンですが、評価結果やコストへの影響は記載なし。
次に確認すること
- 公式のSystem metric versionsで、各メトリクスの対応バージョン、変更点、非推奨ポリシーを確認する。
- 公式のAgent versions in observabilityで、threadおよびtrace上のバージョン表示と保持範囲を検証する。
- 検証用Agentでagent_versionとmetric versionを固定した評価を実行し、同一データセットで再現性を確認する。
- Snowflake管理者と、評価・observability・使用モデルに必要な権限およびアカウントのモデル許可設定を確認する。
公式情報
仕様・提供条件は更新される可能性があります。導入前に必ず公式リリースノートを確認してください。