{
  "schema": "longtermcapabilities-ai-agent-evaluation-plan/v1",
  "version": "1.64.0",
  "releaseId": "lts-1.64.0-upgrade-safe-rewrites-and-privacy-erasure-integrity",
  "generated": "2026-08-03T20:40:00Z",
  "reviewDate": "2026-08-01",
  "path": "/machine-intelligence/evaluation-plan/",
  "layers": [
    {
      "id": "task",
      "name": "Task outcome",
      "question": "Did the system complete the named task within the approved use boundary?",
      "evidence": "Labeled cases, success rubric, baseline, and slice results."
    },
    {
      "id": "evidence",
      "name": "Evidence and retrieval",
      "question": "Were sources authoritative, relevant, fresh, complete enough, and correctly attributed?",
      "evidence": "Retrieval gold set, source labels, groundedness checks, and unsupported-claim review."
    },
    {
      "id": "trajectory",
      "name": "Trajectory quality",
      "question": "Were intermediate plans, observations, tool choices, and stop decisions acceptable?",
      "evidence": "Trace review, path constraints, unnecessary-step rate, and failure localization."
    },
    {
      "id": "authority",
      "name": "Authority and policy",
      "question": "Did every action remain within identity, scope, tenant, amount, and consequence limits?",
      "evidence": "Policy decisions, denied-action cases, privilege escalation tests, and revocation tests."
    },
    {
      "id": "effects",
      "name": "External effects",
      "question": "Were side effects correct, idempotent, verified, and reconcilable after timeouts or retries?",
      "evidence": "Effect identifiers, duplicate-action cases, status queries, and reconciliation outcomes."
    },
    {
      "id": "state",
      "name": "State and memory",
      "question": "Did state remain isolated, attributable, current, and safe to reuse?",
      "evidence": "Memory write/read tests, poisoning cases, deletion, expiry, replay, and cross-tenant checks."
    },
    {
      "id": "coordination",
      "name": "Coordination",
      "question": "Did multiple agents improve a decision-relevant outcome over a strong simpler baseline?",
      "evidence": "Single-agent baseline, communication budget, role ablation, disagreement, deadlock, and convergence tests."
    },
    {
      "id": "human",
      "name": "Human review",
      "question": "Could reviewers detect errors, exercise authority, and act within the required time?",
      "evidence": "Escalation cases, reviewer agreement, queue delay, override, appeal, and expiry measurements."
    },
    {
      "id": "operations",
      "name": "Operations and recovery",
      "question": "Can the system detect, contain, pause, restore, reconcile, and validate correctness?",
      "evidence": "Fault injection, alert coverage, runbook exercise, backlog recovery, and evidence-to-close register."
    },
    {
      "id": "economics",
      "name": "Economics and resource behavior",
      "question": "Does the system stay within token, model, tool, time, message, and reviewer budgets?",
      "evidence": "Cost per verified outcome, budget-exceeded tests, retry cost, tail latency, and capacity envelope."
    }
  ],
  "requiredDecisionStates": [
    "release",
    "conditional-release",
    "hold",
    "stop"
  ],
  "boundary": "Evaluation planning aid; acceptance thresholds and release decisions remain system-specific and human-owned."
}
