{
  "dataset": "veb-canonical-135",
  "description": "The Value Engine Benchmark — canonical 135/model/track grid (13-model board: 11 closed-weight frontier + 2 open-weight). Multi-turn LLM sales-negotiation rollouts with full trajectory (episode) and judge rubric (grade) per datapoint.",
  "generated_at": "2026-08-20T00:00:00Z",
  "sha256": "13a9e6e5ac7a638207423393d24153ac31b9d3b92fdb09a77783c83b2af98f05",
  "rows": 3510,
  "grid": {
    "scenarios": 9,
    "seeds": 15,
    "models": 13,
    "tracks": [
      "oob",
      "pack"
    ],
    "per_model_per_track": 135
  },
  "rows_by_track": {
    "oob": 1755,
    "pack": 1755
  },
  "rows_by_model_track": {
    "claude-fable-5|oob": 135,
    "claude-fable-5|pack": 135,
    "claude-opus-4-6|oob": 135,
    "claude-opus-4-6|pack": 135,
    "claude-opus-4-8|oob": 135,
    "claude-opus-4-8|pack": 135,
    "claude-sonnet-4-6|oob": 135,
    "claude-sonnet-4-6|pack": 135,
    "gemini-3.1-pro-preview|oob": 135,
    "gemini-3.1-pro-preview|pack": 135,
    "gemini-3.5-flash|oob": 135,
    "gemini-3.5-flash|pack": 135,
    "gpt-5.5|oob": 135,
    "gpt-5.5|pack": 135,
    "gpt-5.6-sol|oob": 135,
    "gpt-5.6-sol|pack": 135,
    "grok-4.20-0309-reasoning|oob": 135,
    "grok-4.20-0309-reasoning|pack": 135,
    "grok-4.3|oob": 135,
    "grok-4.3|pack": 135,
    "grok-4.5|oob": 135,
    "grok-4.5|pack": 135,
    "moonshotai/kimi-k3|oob": 135,
    "moonshotai/kimi-k3|pack": 135,
    "thinkingmachines/inkling|oob": 135,
    "thinkingmachines/inkling|pack": 135
  },
  "roster": [
    "claude-fable-5",
    "claude-opus-4-6",
    "claude-opus-4-8",
    "claude-sonnet-4-6",
    "gemini-3.1-pro-preview",
    "gemini-3.5-flash",
    "gpt-5.5",
    "gpt-5.6-sol",
    "grok-4.20-0309-reasoning",
    "grok-4.3",
    "grok-4.5",
    "moonshotai/kimi-k3",
    "thinkingmachines/inkling"
  ],
  "preview": {
    "file": "veb-canonical-135-preview.jsonl",
    "sha256": "5ae95a816f9b25c2efa271041197b850857aa486ad8784a33a8200cfd1f1c837",
    "rows": 78,
    "license": "CC BY-NC 4.0 (free evaluation sample) — full dataset license negotiated separately",
    "sampling": "stratified: 6 rows per model (all 13), both tracks, 8 of 9 scenarios; deliberately over-samples rare high-signal outcomes so the judge rubric is visibly discriminating",
    "coverage": {
      "models": 13,
      "tracks": {
        "oob": 59,
        "pack": 19
      },
      "scenarios": 8,
      "outcomes": {
        "won": 25,
        "lost": 16,
        "walked_away": 12,
        "buyer_dark": 9,
        "no_decision": 16
      }
    },
    "same_schema_as_full": true,
    "note": "Every preview row is a verbatim full-fidelity datapoint (episode+grade embedded) drawn from the full dataset — not a reduced or redacted view."
  },
  "outcome_distribution_full": {
    "no_decision": 2768,
    "lost": 193,
    "won": 330,
    "walked_away": 176,
    "buyer_dark": 43
  },
  "datasheet": "DATASHEET.md",
  "dedup_key": "(scenario_id, model, pack, seed) — latest generated_at wins",
  "row_schema": {
    "top_level": [
      "id",
      "env",
      "model",
      "buyer_sim",
      "seed",
      "reward",
      "resolved",
      "cleared_bar",
      "reward_breakdown",
      "trajectory",
      "format_retries",
      "cost",
      "transcript_ref",
      "provenance",
      "generated_at",
      "episode",
      "grade"
    ],
    "episode": [
      "scenarioId",
      "sellerId",
      "pack",
      "mock",
      "startedAt",
      "finishedAt",
      "turns",
      "events",
      "signals",
      "internalChannel",
      "finalState",
      "outcome"
    ],
    "grade": [
      "scenarioId",
      "sellerId",
      "pack",
      "gradedAt",
      "judge",
      "outcome",
      "meddpicc",
      "threeWhys",
      "ebEngagement",
      "mapDatesConfirmedPct",
      "champion",
      "conditionalCommitmentBeforeProof",
      "priceIntegrity",
      "dvi",
      "saleQualityScore",
      "failureModes",
      "scenarioMeta",
      "walkAways",
      "internalChannelReveal",
      "notes"
    ]
  },
  "notes": "Open-weight endpoints kimi-k3 (Moonshot) and inkling (Thinking Machines) join the 11 closed-weight frontier models to form the 13-endpoint canonical roster; both are graded on every cell and ranked alongside the closed frontier. gpt-5.5-pro excluded (off-roster reasoning-only exploratory arm). One datapoint = one JSONL line, fully self-contained (episode+grade embedded)."
}
