{"id":18685,"plugin_id":"plugins_6a8b1e75fc008191a65fa89587954dc6","kind":"skill","collection_source":null,"comparison_source":null,"observed_at":"2026-09-30T23:14:53.391Z","digest":"612c1ec47cf5b361eabde5309ec6694e3815d54349ccba6345b87ba85cc9f50c","against":null,"payload":{"description":"Use when the user asks to run or rerun a Raw vs CompText benchmark, validate token reduction, or check quality regressions.","included_files":[{"relative_path":"agents/openai.yaml","size_in_bytes":302}],"name":"run-benchmark","skill_md_contents":"---\nname: run-benchmark\ndescription: Use when the user asks to run or rerun a Raw vs CompText benchmark, validate token reduction, or check quality regressions.\n---\n\n# Run benchmark\n\nFor the built-in offline fixture run exactly:\n\n`node \"${CODEX_HOME:-$HOME/.codex}/plugins/cache/comptext-marketplace/comptext-benchmark/0.1.5/scripts/smoke-receipt.mjs\" /root/comptext/apps/comptext-benchmark-lab`\n\nTreat its single JSON line as the primary evidence receipt. Do not run `find`, list run files, inspect bundled script source, or read full `result.json` unless that command fails or the user asks for raw evidence.\n\nFor live runs, reuse the Benchmark Lab, freeze one manifest, keep non-experimental variables identical across arms, and load `../../references/benchmark-policy.md`. MCP is optional.\n\nNever claim an efficiency win when the receipt reports a quality regression. Return status, digests, runner/model, arm state, quality, efficiency, verdict, and artifact paths."},"changes":[],"summary":"First saved snapshot. No earlier version is available for comparison.","summary_kind":"deterministic","summary_metadata":{}}