{
  "type": "controlled-study-observation-ledger",
  "schemaVersion": 1,
  "ledgerVersion": "v1",
  "observations": [
    {
      "type": "controlled-study-observation",
      "schemaVersion": 1,
      "observationVersion": "v1",
      "observedAt": "2026-09-13T00:55:41.433Z",
      "runId": "phase4-public-pilot-04",
      "planHash": "fdc33d417de30a1aa48cc0711c89d87096bb2ad628b5d43f32046e9d0c16ef6a",
      "task": {
        "taskId": "public-fixture-architecture",
        "repositoryId": "public-fixture",
        "category": "architecture",
        "scenarioId": "repository-only",
        "modelId": "low-cost-model",
        "replicate": 0,
        "variantId": "variant-a",
        "difficulty": "medium"
      },
      "model": {
        "id": "low-cost-model",
        "role": "low-cost",
        "provider": "codex",
        "model": "gpt-5.6-sol",
        "version": "codex-cli-0.154.0",
        "parametersHash": "6dc5481139cc4fc6960a38ffd4c7e68605108d0d3eac9ac3c269c92703200273",
        "contextLimit": 272000,
        "toolConfigurationHash": "a08b38a4fa7e559811713cabc2e2f62cb05ef266d406dcb38cf46be627417e20",
        "promptContractHash": "5ba19f0e4ea57c4206d2965a55fc1bbd081348a8ccf89c86ff64a81df93bf98b"
      },
      "scenario": {
        "id": "repository-only",
        "network": false
      },
      "execution": {
        "status": "completed",
        "exitCode": 0,
        "signal": null,
        "durationMs": 36654,
        "responseBytes": 795,
        "stderrBytes": 0,
        "stdoutHash": "e6982a2468d92733edd4c0849550663bfcad9e4210fee4f237540dea1da77074",
        "stderrHash": "e3b0c44298fc1c149afbf4c8996fb92427ae41e4649b934ca495991b7852b855",
        "inputTokens": 63739,
        "outputTokens": 978,
        "tokenMethod": "provider",
        "toolCalls": 2
      },
      "contextBytes": 2583,
      "contextTokens": 646,
      "contextTokenMethod": "estimate",
      "evidenceIds": [
        "doc-bridge.config.json",
        "package.json",
        "packages/os-core/package.json",
        "docs/for-agents/INDEX.md",
        "docs/for-agents/packages/os-core.md",
        "docs/human/(reference)/packages/os-core/index.md",
        "fixture-architecture-check"
      ],
      "round": "phase4-public-pilot-04",
      "taskOutcome": "success",
      "evidenceQuality": "high",
      "safetyOutcome": "safe",
      "clarificationRequests": 0,
      "reworkCount": 0,
      "measurements": {
        "acceptanceChecksPassed": 1,
        "acceptanceChecksTotal": 1,
        "acceptanceChecksExecuted": 1,
        "entrypointEvidenceCount": 1,
        "ownershipEvidenceCount": 2,
        "architectureRelationCount": 1,
        "documentationClaimEvidenceCount": 3,
        "sourceComparisonEvidenceCount": 1,
        "verificationEvidenceCount": 1,
        "errorRate": 0,
        "cachedInputTokens": 20480,
        "reasoningOutputTokens": 364,
        "stderrBytes": 0,
        "providerTokenCostUnits": 64717
      },
      "adjudication": {
        "status": "automated",
        "actor": "deterministic-rubric-v1",
        "method": "deterministic-rubric-v1",
        "outcome": "partial",
        "reason": "Independent bounded evaluation of execution status, acceptance metrics, and exact required evidence coverage."
      },
      "contentHash": "35895b5f25b15294e108641d8077be1cf86e814a501a180e041d769ae7328f17",
      "contentHashAlgo": "sha256-normalized-v1"
    },
    {
      "type": "controlled-study-observation",
      "schemaVersion": 1,
      "observationVersion": "v1",
      "observedAt": "2026-09-13T00:56:10.383Z",
      "runId": "phase4-public-pilot-04",
      "planHash": "fdc33d417de30a1aa48cc0711c89d87096bb2ad628b5d43f32046e9d0c16ef6a",
      "task": {
        "taskId": "public-fixture-implementation",
        "repositoryId": "public-fixture",
        "category": "implementation",
        "scenarioId": "deterministic-doc-bridge",
        "modelId": "reference-model",
        "replicate": 0,
        "variantId": "variant-a",
        "difficulty": "hard"
      },
      "model": {
        "id": "reference-model",
        "role": "reference",
        "provider": "codex",
        "model": "gpt-5.6-luna",
        "version": "codex-cli-0.154.0",
        "parametersHash": "785593a535c713ae8015defb031047fb9ae55926ec4ac0cb0cafcdaa5cba1e30",
        "contextLimit": 272000,
        "toolConfigurationHash": "d2fe8bbf1fa6add2b357c4a199a37224c03bbe4edf29901ff45ae0ef8ee99366",
        "promptContractHash": "5ba19f0e4ea57c4206d2965a55fc1bbd081348a8ccf89c86ff64a81df93bf98b"
      },
      "scenario": {
        "id": "deterministic-doc-bridge",
        "network": false
      },
      "execution": {
        "status": "completed",
        "exitCode": 0,
        "signal": null,
        "durationMs": 28940,
        "responseBytes": 417,
        "stderrBytes": 0,
        "stdoutHash": "e23ef1390aeff2d8bdf66b8e93880257b173493ce48cc169f12f4a5f0dc8cf30",
        "stderrHash": "e3b0c44298fc1c149afbf4c8996fb92427ae41e4649b934ca495991b7852b855",
        "inputTokens": 79246,
        "outputTokens": 1258,
        "tokenMethod": "provider",
        "toolCalls": 3
      },
      "contextBytes": 2734,
      "contextTokens": 684,
      "contextTokenMethod": "estimate",
      "evidenceIds": [
        "patch-evidence",
        "verification-plan"
      ],
      "round": "phase4-public-pilot-04",
      "taskOutcome": "success",
      "evidenceQuality": "high",
      "safetyOutcome": "safe",
      "clarificationRequests": 0,
      "reworkCount": 0,
      "measurements": {
        "acceptanceChecksPassed": 1,
        "acceptanceChecksTotal": 1,
        "acceptanceChecksExecuted": 1,
        "cachedInputTokens": 56576,
        "reasoningOutputTokens": 706,
        "stderrBytes": 0,
        "providerTokenCostUnits": 80504
      },
      "adjudication": {
        "status": "automated",
        "actor": "deterministic-rubric-v1",
        "method": "deterministic-rubric-v1",
        "outcome": "success",
        "reason": "Independent bounded evaluation of execution status, acceptance metrics, and exact required evidence coverage."
      },
      "contentHash": "841657e62d344408cf5a38ac718ee0450f3a3dd269bfa6aa022b0609cf55195d",
      "contentHashAlgo": "sha256-normalized-v1"
    },
    {
      "type": "controlled-study-observation",
      "schemaVersion": 1,
      "observationVersion": "v1",
      "observedAt": "2026-09-13T00:56:52.391Z",
      "runId": "phase4-public-pilot-04",
      "planHash": "fdc33d417de30a1aa48cc0711c89d87096bb2ad628b5d43f32046e9d0c16ef6a",
      "task": {
        "taskId": "public-fixture-documentation",
        "repositoryId": "public-fixture",
        "category": "documentation",
        "scenarioId": "deterministic-doc-bridge",
        "modelId": "reference-model",
        "replicate": 0,
        "variantId": "variant-a",
        "difficulty": "hard"
      },
      "model": {
        "id": "reference-model",
        "role": "reference",
        "provider": "codex",
        "model": "gpt-5.6-luna",
        "version": "codex-cli-0.154.0",
        "parametersHash": "785593a535c713ae8015defb031047fb9ae55926ec4ac0cb0cafcdaa5cba1e30",
        "contextLimit": 272000,
        "toolConfigurationHash": "d2fe8bbf1fa6add2b357c4a199a37224c03bbe4edf29901ff45ae0ef8ee99366",
        "promptContractHash": "5ba19f0e4ea57c4206d2965a55fc1bbd081348a8ccf89c86ff64a81df93bf98b"
      },
      "scenario": {
        "id": "deterministic-doc-bridge",
        "network": false
      },
      "execution": {
        "status": "completed",
        "exitCode": 0,
        "signal": null,
        "durationMs": 42007,
        "responseBytes": 1013,
        "stderrBytes": 0,
        "stdoutHash": "c8436af12d0b1aeaf973dfcda0bb56652b9129f3b2fb3637241faee09fe0d9a4",
        "stderrHash": "e3b0c44298fc1c149afbf4c8996fb92427ae41e4649b934ca495991b7852b855",
        "inputTokens": 103695,
        "outputTokens": 1533,
        "tokenMethod": "provider",
        "toolCalls": 4,
        "firstEvidenceLatencyMs": 103
      },
      "contextBytes": 2784,
      "contextTokens": 696,
      "contextTokenMethod": "estimate",
      "evidenceIds": [
        "evidence-b66d032d7a873f3f4e4edc3c7f5e0da5",
        "review-limitation:Classification is based on the fixture's static documentation, metadata, generated index, and routing configuration; runtime routing behavior was not exercised. Confidence: high.",
        "next-action:Add an os-core ownership/routing link or summary to docs/for-agents/INDEX.md, then regenerate .doc-bridge/index.json and llms.txt."
      ],
      "round": "phase4-public-pilot-04",
      "taskOutcome": "success",
      "evidenceQuality": "high",
      "safetyOutcome": "safe",
      "firstEvidenceLatencyMs": 103,
      "clarificationRequests": 0,
      "reworkCount": 0,
      "measurements": {
        "acceptanceChecksPassed": 1,
        "acceptanceChecksTotal": 1,
        "acceptanceChecksExecuted": 1,
        "entrypointEvidenceCount": 3,
        "ownershipEvidenceCount": 2,
        "architectureRelationCount": 1,
        "documentationClaimEvidenceCount": 1,
        "sourceComparisonEvidenceCount": 5,
        "verificationEvidenceCount": 1,
        "documentationFindingCount": 1,
        "cachedInputTokens": 77824,
        "reasoningOutputTokens": 500,
        "stderrBytes": 0,
        "providerTokenCostUnits": 105228
      },
      "adjudication": {
        "status": "automated",
        "actor": "deterministic-rubric-v1",
        "method": "deterministic-rubric-v1",
        "outcome": "partial",
        "reason": "Independent bounded evaluation of execution status, acceptance metrics, and exact required evidence coverage."
      },
      "contentHash": "81d698420f08c7b6551ef69fc8e4ae583cab5fc6a6b350ce74da885ee41d7c70",
      "contentHashAlgo": "sha256-normalized-v1"
    },
    {
      "type": "controlled-study-observation",
      "schemaVersion": 1,
      "observationVersion": "v1",
      "observedAt": "2026-09-13T00:57:29.068Z",
      "runId": "phase4-public-pilot-04",
      "planHash": "fdc33d417de30a1aa48cc0711c89d87096bb2ad628b5d43f32046e9d0c16ef6a",
      "task": {
        "taskId": "public-fixture-documentation",
        "repositoryId": "public-fixture",
        "category": "documentation",
        "scenarioId": "deterministic-doc-bridge",
        "modelId": "low-cost-model",
        "replicate": 0,
        "variantId": "variant-b",
        "difficulty": "hard"
      },
      "model": {
        "id": "low-cost-model",
        "role": "low-cost",
        "provider": "codex",
        "model": "gpt-5.6-sol",
        "version": "codex-cli-0.154.0",
        "parametersHash": "6dc5481139cc4fc6960a38ffd4c7e68605108d0d3eac9ac3c269c92703200273",
        "contextLimit": 272000,
        "toolConfigurationHash": "a08b38a4fa7e559811713cabc2e2f62cb05ef266d406dcb38cf46be627417e20",
        "promptContractHash": "5ba19f0e4ea57c4206d2965a55fc1bbd081348a8ccf89c86ff64a81df93bf98b"
      },
      "scenario": {
        "id": "deterministic-doc-bridge",
        "network": false
      },
      "execution": {
        "status": "completed",
        "exitCode": 0,
        "signal": null,
        "durationMs": 36675,
        "responseBytes": 822,
        "stderrBytes": 0,
        "stdoutHash": "bdd303a248aeee8bd03cacd996c99ea29c3a616d880a7090f1ae32f05490e3a0",
        "stderrHash": "e3b0c44298fc1c149afbf4c8996fb92427ae41e4649b934ca495991b7852b855",
        "inputTokens": 85165,
        "outputTokens": 1445,
        "tokenMethod": "provider",
        "toolCalls": 3
      },
      "contextBytes": 2783,
      "contextTokens": 696,
      "contextTokenMethod": "estimate",
      "evidenceIds": [
        "evidence-44f17a288d90dcdddd6c89dead751c80",
        "review-limitation:semantic finding is based on the bounded fixture surfaces; repository-level verification was unavailable because .codex/verification.json is absent, so the required acceptance check was not executed or counted as passed."
      ],
      "round": "phase4-public-pilot-04",
      "taskOutcome": "partial",
      "evidenceQuality": "medium",
      "safetyOutcome": "safe",
      "clarificationRequests": 0,
      "reworkCount": 0,
      "measurements": {
        "acceptanceChecksPassed": 0,
        "acceptanceChecksTotal": 1,
        "acceptanceChecksExecuted": 0,
        "entrypointEvidenceCount": 2,
        "ownershipEvidenceCount": 2,
        "documentationClaimEvidenceCount": 1,
        "sourceComparisonEvidenceCount": 4,
        "documentationFindingCount": 1,
        "cachedInputTokens": 62336,
        "reasoningOutputTokens": 753,
        "stderrBytes": 0,
        "providerTokenCostUnits": 86610
      },
      "adjudication": {
        "status": "automated",
        "actor": "deterministic-rubric-v1",
        "method": "deterministic-rubric-v1",
        "outcome": "incomplete",
        "reason": "Independent bounded evaluation of execution status, acceptance metrics, and exact required evidence coverage."
      },
      "contentHash": "275fdee5fd70ca228c316b1cfe3ab7fbf77442fafad0c26068aad1317992362d",
      "contentHashAlgo": "sha256-normalized-v1"
    },
    {
      "type": "controlled-study-observation",
      "schemaVersion": 1,
      "observationVersion": "v1",
      "observedAt": "2026-09-13T00:58:06.033Z",
      "runId": "phase4-public-pilot-04",
      "planHash": "fdc33d417de30a1aa48cc0711c89d87096bb2ad628b5d43f32046e9d0c16ef6a",
      "task": {
        "taskId": "public-fixture-discovery",
        "repositoryId": "public-fixture",
        "category": "discovery",
        "scenarioId": "repository-only",
        "modelId": "low-cost-model",
        "replicate": 0,
        "variantId": "variant-a",
        "difficulty": "easy"
      },
      "model": {
        "id": "low-cost-model",
        "role": "low-cost",
        "provider": "codex",
        "model": "gpt-5.6-sol",
        "version": "codex-cli-0.154.0",
        "parametersHash": "6dc5481139cc4fc6960a38ffd4c7e68605108d0d3eac9ac3c269c92703200273",
        "contextLimit": 272000,
        "toolConfigurationHash": "a08b38a4fa7e559811713cabc2e2f62cb05ef266d406dcb38cf46be627417e20",
        "promptContractHash": "5ba19f0e4ea57c4206d2965a55fc1bbd081348a8ccf89c86ff64a81df93bf98b"
      },
      "scenario": {
        "id": "repository-only",
        "network": false
      },
      "execution": {
        "status": "completed",
        "exitCode": 0,
        "signal": null,
        "durationMs": 36961,
        "responseBytes": 715,
        "stderrBytes": 0,
        "stdoutHash": "717c1decef6accb33bae10490903028dceb5e21d0b4dc6dead30457ecd464f2a",
        "stderrHash": "e3b0c44298fc1c149afbf4c8996fb92427ae41e4649b934ca495991b7852b855",
        "inputTokens": 88967,
        "outputTokens": 907,
        "tokenMethod": "provider",
        "toolCalls": 4
      },
      "contextBytes": 2483,
      "contextTokens": 621,
      "contextTokenMethod": "estimate",
      "evidenceIds": [
        "doc-bridge.config.json:agent-index",
        "doc-bridge.config.json:os-core-ownership",
        "llms.txt:agent-docs-index",
        "docs/for-agents/INDEX.md:canonical-entrypoint",
        "docs/for-agents/packages/os-core.md:ownership",
        "fixture-discovery-check:exit-0"
      ],
      "round": "phase4-public-pilot-04",
      "taskOutcome": "success",
      "evidenceQuality": "high",
      "safetyOutcome": "safe",
      "clarificationRequests": 0,
      "reworkCount": 0,
      "measurements": {
        "acceptanceChecksPassed": 1,
        "acceptanceChecksTotal": 1,
        "acceptanceChecksExecuted": 1,
        "entrypointEvidenceCount": 2,
        "ownershipEvidenceCount": 2,
        "verificationEvidenceCount": 1,
        "errorRate": 0,
        "cachedInputTokens": 65408,
        "reasoningOutputTokens": 227,
        "stderrBytes": 0,
        "providerTokenCostUnits": 89874
      },
      "adjudication": {
        "status": "automated",
        "actor": "deterministic-rubric-v1",
        "method": "deterministic-rubric-v1",
        "outcome": "partial",
        "reason": "Independent bounded evaluation of execution status, acceptance metrics, and exact required evidence coverage."
      },
      "contentHash": "ad48e0252a8852d866d1624cc2d0c75ff51aa8450e92a8671544e142c111d4b9",
      "contentHashAlgo": "sha256-normalized-v1"
    },
    {
      "type": "controlled-study-observation",
      "schemaVersion": 1,
      "observationVersion": "v1",
      "observedAt": "2026-09-13T00:58:30.344Z",
      "runId": "phase4-public-pilot-04",
      "planHash": "fdc33d417de30a1aa48cc0711c89d87096bb2ad628b5d43f32046e9d0c16ef6a",
      "task": {
        "taskId": "public-fixture-architecture",
        "repositoryId": "public-fixture",
        "category": "architecture",
        "scenarioId": "deterministic-doc-bridge",
        "modelId": "reference-model",
        "replicate": 0,
        "variantId": "variant-b",
        "difficulty": "medium"
      },
      "model": {
        "id": "reference-model",
        "role": "reference",
        "provider": "codex",
        "model": "gpt-5.6-luna",
        "version": "codex-cli-0.154.0",
        "parametersHash": "785593a535c713ae8015defb031047fb9ae55926ec4ac0cb0cafcdaa5cba1e30",
        "contextLimit": 272000,
        "toolConfigurationHash": "d2fe8bbf1fa6add2b357c4a199a37224c03bbe4edf29901ff45ae0ef8ee99366",
        "promptContractHash": "5ba19f0e4ea57c4206d2965a55fc1bbd081348a8ccf89c86ff64a81df93bf98b"
      },
      "scenario": {
        "id": "deterministic-doc-bridge",
        "network": false
      },
      "execution": {
        "status": "completed",
        "exitCode": 0,
        "signal": null,
        "durationMs": 24305,
        "responseBytes": 488,
        "stderrBytes": 0,
        "stdoutHash": "7d10eadbdcdf7f3ace2d9226d740668da8a9913bcb4f028a956d85d46742a2f5",
        "stderrHash": "e3b0c44298fc1c149afbf4c8996fb92427ae41e4649b934ca495991b7852b855",
        "inputTokens": 59068,
        "outputTokens": 951,
        "tokenMethod": "provider",
        "toolCalls": 2
      },
      "contextBytes": 2593,
      "contextTokens": 649,
      "contextTokenMethod": "estimate",
      "evidenceIds": [
        "architecture-evidence"
      ],
      "round": "phase4-public-pilot-04",
      "taskOutcome": "success",
      "evidenceQuality": "high",
      "safetyOutcome": "safe",
      "clarificationRequests": 0,
      "reworkCount": 0,
      "measurements": {
        "acceptanceChecksPassed": 1,
        "acceptanceChecksTotal": 1,
        "acceptanceChecksExecuted": 1,
        "entrypointEvidenceCount": 1,
        "ownershipEvidenceCount": 1,
        "architectureRelationCount": 1,
        "cachedInputTokens": 37376,
        "reasoningOutputTokens": 417,
        "stderrBytes": 0,
        "providerTokenCostUnits": 60019
      },
      "adjudication": {
        "status": "automated",
        "actor": "deterministic-rubric-v1",
        "method": "deterministic-rubric-v1",
        "outcome": "success",
        "reason": "Independent bounded evaluation of execution status, acceptance metrics, and exact required evidence coverage."
      },
      "contentHash": "70ed76997b8990f34cf026fb8dd7ad1e7e6d02e7a691abc349b22fe6407cf744",
      "contentHashAlgo": "sha256-normalized-v1"
    },
    {
      "type": "controlled-study-observation",
      "schemaVersion": 1,
      "observationVersion": "v1",
      "observedAt": "2026-09-13T00:58:58.398Z",
      "runId": "phase4-public-pilot-04",
      "planHash": "fdc33d417de30a1aa48cc0711c89d87096bb2ad628b5d43f32046e9d0c16ef6a",
      "task": {
        "taskId": "public-fixture-documentation",
        "repositoryId": "public-fixture",
        "category": "documentation",
        "scenarioId": "repository-only",
        "modelId": "low-cost-model",
        "replicate": 0,
        "variantId": "variant-b",
        "difficulty": "hard"
      },
      "model": {
        "id": "low-cost-model",
        "role": "low-cost",
        "provider": "codex",
        "model": "gpt-5.6-sol",
        "version": "codex-cli-0.154.0",
        "parametersHash": "6dc5481139cc4fc6960a38ffd4c7e68605108d0d3eac9ac3c269c92703200273",
        "contextLimit": 272000,
        "toolConfigurationHash": "a08b38a4fa7e559811713cabc2e2f62cb05ef266d406dcb38cf46be627417e20",
        "promptContractHash": "5ba19f0e4ea57c4206d2965a55fc1bbd081348a8ccf89c86ff64a81df93bf98b"
      },
      "scenario": {
        "id": "repository-only",
        "network": false
      },
      "execution": {
        "status": "completed",
        "exitCode": 0,
        "signal": null,
        "durationMs": 28046,
        "responseBytes": 1077,
        "stderrBytes": 0,
        "stdoutHash": "76c60c1941fdddea2beacca98f556d1b1b5e6884420ddd9ea361f34de56688e6",
        "stderrHash": "e3b0c44298fc1c149afbf4c8996fb92427ae41e4649b934ca495991b7852b855",
        "inputTokens": 62800,
        "outputTokens": 893,
        "tokenMethod": "provider",
        "toolCalls": 2
      },
      "contextBytes": 2774,
      "contextTokens": 694,
      "contextTokenMethod": "estimate",
      "evidenceIds": [
        "evidence-b82423bf379c9983634d8905914f5b20",
        "review-limitation:high-confidence bounded semantic comparison of the three requested surfaces only; repository-wide documentation completeness was not analyzed.",
        "next-action:generate or add package ownership and intent-routing details to docs/for-agents/INDEX.md, then verify that llms.txt metadata still accurately describes it.",
        "verification-evidence:fixture-documentation-check exited 0; docs/for-agents/INDEX.md, llms.txt, and doc-bridge.config.json all exist."
      ],
      "round": "phase4-public-pilot-04",
      "taskOutcome": "success",
      "evidenceQuality": "high",
      "safetyOutcome": "safe",
      "clarificationRequests": 0,
      "reworkCount": 0,
      "measurements": {
        "acceptanceChecksPassed": 1,
        "acceptanceChecksTotal": 1,
        "acceptanceChecksExecuted": 1,
        "entrypointEvidenceCount": 3,
        "ownershipEvidenceCount": 1,
        "documentationClaimEvidenceCount": 3,
        "sourceComparisonEvidenceCount": 3,
        "verificationEvidenceCount": 1,
        "documentationFindingCount": 1,
        "cachedInputTokens": 56960,
        "reasoningOutputTokens": 287,
        "stderrBytes": 0,
        "providerTokenCostUnits": 63693
      },
      "adjudication": {
        "status": "automated",
        "actor": "deterministic-rubric-v1",
        "method": "deterministic-rubric-v1",
        "outcome": "partial",
        "reason": "Independent bounded evaluation of execution status, acceptance metrics, and exact required evidence coverage."
      },
      "contentHash": "13c07bcf660a5c6729830a32829efed6757b321968278158658fc3865b63f989",
      "contentHashAlgo": "sha256-normalized-v1"
    },
    {
      "type": "controlled-study-observation",
      "schemaVersion": 1,
      "observationVersion": "v1",
      "observedAt": "2026-09-13T00:59:31.303Z",
      "runId": "phase4-public-pilot-04",
      "planHash": "fdc33d417de30a1aa48cc0711c89d87096bb2ad628b5d43f32046e9d0c16ef6a",
      "task": {
        "taskId": "public-fixture-implementation",
        "repositoryId": "public-fixture",
        "category": "implementation",
        "scenarioId": "deterministic-doc-bridge",
        "modelId": "low-cost-model",
        "replicate": 0,
        "variantId": "variant-a",
        "difficulty": "hard"
      },
      "model": {
        "id": "low-cost-model",
        "role": "low-cost",
        "provider": "codex",
        "model": "gpt-5.6-sol",
        "version": "codex-cli-0.154.0",
        "parametersHash": "6dc5481139cc4fc6960a38ffd4c7e68605108d0d3eac9ac3c269c92703200273",
        "contextLimit": 272000,
        "toolConfigurationHash": "a08b38a4fa7e559811713cabc2e2f62cb05ef266d406dcb38cf46be627417e20",
        "promptContractHash": "5ba19f0e4ea57c4206d2965a55fc1bbd081348a8ccf89c86ff64a81df93bf98b"
      },
      "scenario": {
        "id": "deterministic-doc-bridge",
        "network": false
      },
      "execution": {
        "status": "completed",
        "exitCode": 0,
        "signal": null,
        "durationMs": 32901,
        "responseBytes": 667,
        "stderrBytes": 0,
        "stdoutHash": "111f1c08c08b4c307f1df30ffa64f8a1880668a3f1420909fe39625de5f5d3f2",
        "stderrHash": "e3b0c44298fc1c149afbf4c8996fb92427ae41e4649b934ca495991b7852b855",
        "inputTokens": 63553,
        "outputTokens": 1117,
        "tokenMethod": "provider",
        "toolCalls": 5
      },
      "contextBytes": 2733,
      "contextTokens": 684,
      "contextTokenMethod": "estimate",
      "evidenceIds": [
        "evidence-8187b6baaf99345488df05c81f1d94bc",
        "evidence-43ee9710704a972f6cd71595f5830243"
      ],
      "round": "phase4-public-pilot-04",
      "taskOutcome": "success",
      "evidenceQuality": "high",
      "safetyOutcome": "safe",
      "clarificationRequests": 0,
      "reworkCount": 0,
      "measurements": {
        "acceptanceChecksPassed": 1,
        "acceptanceChecksTotal": 1,
        "acceptanceChecksExecuted": 1,
        "entrypointEvidenceCount": 1,
        "ownershipEvidenceCount": 1,
        "documentationClaimEvidenceCount": 1,
        "sourceComparisonEvidenceCount": 1,
        "verificationEvidenceCount": 1,
        "errorRate": 0,
        "documentationFindingCount": 1,
        "cachedInputTokens": 20352,
        "reasoningOutputTokens": 283,
        "stderrBytes": 0,
        "providerTokenCostUnits": 64670
      },
      "adjudication": {
        "status": "automated",
        "actor": "deterministic-rubric-v1",
        "method": "deterministic-rubric-v1",
        "outcome": "partial",
        "reason": "Independent bounded evaluation of execution status, acceptance metrics, and exact required evidence coverage."
      },
      "contentHash": "eebfbb6dc686092fd74ef604908878188b6ff3aa41baab25c036b2a386ef1c43",
      "contentHashAlgo": "sha256-normalized-v1"
    },
    {
      "type": "controlled-study-observation",
      "schemaVersion": 1,
      "observationVersion": "v1",
      "observedAt": "2026-09-13T00:59:59.390Z",
      "runId": "phase4-public-pilot-04",
      "planHash": "fdc33d417de30a1aa48cc0711c89d87096bb2ad628b5d43f32046e9d0c16ef6a",
      "task": {
        "taskId": "public-fixture-implementation",
        "repositoryId": "public-fixture",
        "category": "implementation",
        "scenarioId": "repository-only",
        "modelId": "reference-model",
        "replicate": 0,
        "variantId": "variant-b",
        "difficulty": "hard"
      },
      "model": {
        "id": "reference-model",
        "role": "reference",
        "provider": "codex",
        "model": "gpt-5.6-luna",
        "version": "codex-cli-0.154.0",
        "parametersHash": "785593a535c713ae8015defb031047fb9ae55926ec4ac0cb0cafcdaa5cba1e30",
        "contextLimit": 272000,
        "toolConfigurationHash": "d2fe8bbf1fa6add2b357c4a199a37224c03bbe4edf29901ff45ae0ef8ee99366",
        "promptContractHash": "5ba19f0e4ea57c4206d2965a55fc1bbd081348a8ccf89c86ff64a81df93bf98b"
      },
      "scenario": {
        "id": "repository-only",
        "network": false
      },
      "execution": {
        "status": "completed",
        "exitCode": 0,
        "signal": null,
        "durationMs": 28083,
        "responseBytes": 543,
        "stderrBytes": 0,
        "stdoutHash": "5495d99e2f94992016c6b97172f5aad14522f0c527dc6efee9094ea86c861844",
        "stderrHash": "e3b0c44298fc1c149afbf4c8996fb92427ae41e4649b934ca495991b7852b855",
        "inputTokens": 100803,
        "outputTokens": 1064,
        "tokenMethod": "provider",
        "toolCalls": 4
      },
      "contextBytes": 2725,
      "contextTokens": 682,
      "contextTokenMethod": "estimate",
      "evidenceIds": [
        "patch-evidence",
        "verification-plan"
      ],
      "round": "phase4-public-pilot-04",
      "taskOutcome": "success",
      "evidenceQuality": "high",
      "safetyOutcome": "safe",
      "clarificationRequests": 0,
      "reworkCount": 0,
      "measurements": {
        "acceptanceChecksPassed": 1,
        "acceptanceChecksTotal": 1,
        "acceptanceChecksExecuted": 1,
        "entrypointEvidenceCount": 1,
        "ownershipEvidenceCount": 1,
        "documentationClaimEvidenceCount": 2,
        "sourceComparisonEvidenceCount": 1,
        "cachedInputTokens": 93952,
        "reasoningOutputTokens": 357,
        "stderrBytes": 0,
        "providerTokenCostUnits": 101867
      },
      "adjudication": {
        "status": "automated",
        "actor": "deterministic-rubric-v1",
        "method": "deterministic-rubric-v1",
        "outcome": "success",
        "reason": "Independent bounded evaluation of execution status, acceptance metrics, and exact required evidence coverage."
      },
      "contentHash": "0addd97444f207628c050524f7a3054fc283eb36bc1bdc7545e3e9b38a6a60dc",
      "contentHashAlgo": "sha256-normalized-v1"
    },
    {
      "type": "controlled-study-observation",
      "schemaVersion": 1,
      "observationVersion": "v1",
      "observedAt": "2026-09-13T01:00:32.984Z",
      "runId": "phase4-public-pilot-04",
      "planHash": "fdc33d417de30a1aa48cc0711c89d87096bb2ad628b5d43f32046e9d0c16ef6a",
      "task": {
        "taskId": "public-fixture-documentation",
        "repositoryId": "public-fixture",
        "category": "documentation",
        "scenarioId": "repository-only",
        "modelId": "reference-model",
        "replicate": 0,
        "variantId": "variant-a",
        "difficulty": "hard"
      },
      "model": {
        "id": "reference-model",
        "role": "reference",
        "provider": "codex",
        "model": "gpt-5.6-luna",
        "version": "codex-cli-0.154.0",
        "parametersHash": "785593a535c713ae8015defb031047fb9ae55926ec4ac0cb0cafcdaa5cba1e30",
        "contextLimit": 272000,
        "toolConfigurationHash": "d2fe8bbf1fa6add2b357c4a199a37224c03bbe4edf29901ff45ae0ef8ee99366",
        "promptContractHash": "5ba19f0e4ea57c4206d2965a55fc1bbd081348a8ccf89c86ff64a81df93bf98b"
      },
      "scenario": {
        "id": "repository-only",
        "network": false
      },
      "execution": {
        "status": "completed",
        "exitCode": 0,
        "signal": null,
        "durationMs": 33589,
        "responseBytes": 455,
        "stderrBytes": 0,
        "stdoutHash": "98017dc4ba137e5fc54d770b26067f72c39c30cb3ee9656146d701d752d395f6",
        "stderrHash": "e3b0c44298fc1c149afbf4c8996fb92427ae41e4649b934ca495991b7852b855",
        "inputTokens": 78780,
        "outputTokens": 1216,
        "tokenMethod": "provider",
        "toolCalls": 3
      },
      "contextBytes": 2775,
      "contextTokens": 694,
      "contextTokenMethod": "estimate",
      "evidenceIds": [
        "documentation-evidence",
        "review-limitation"
      ],
      "round": "phase4-public-pilot-04",
      "taskOutcome": "success",
      "evidenceQuality": "high",
      "safetyOutcome": "safe",
      "clarificationRequests": 0,
      "reworkCount": 0,
      "measurements": {
        "acceptanceChecksPassed": 1,
        "acceptanceChecksTotal": 1,
        "acceptanceChecksExecuted": 1,
        "documentationFindingCount": 1,
        "cachedInputTokens": 56576,
        "reasoningOutputTokens": 491,
        "stderrBytes": 0,
        "providerTokenCostUnits": 79996
      },
      "adjudication": {
        "status": "automated",
        "actor": "deterministic-rubric-v1",
        "method": "deterministic-rubric-v1",
        "outcome": "success",
        "reason": "Independent bounded evaluation of execution status, acceptance metrics, and exact required evidence coverage."
      },
      "contentHash": "3dbc4eab178e1d9b55514148b47965119a34c3fa16061b32c15fbf14bb3cac62",
      "contentHashAlgo": "sha256-normalized-v1"
    },
    {
      "type": "controlled-study-observation",
      "schemaVersion": 1,
      "observationVersion": "v1",
      "observedAt": "2026-09-13T01:00:58.725Z",
      "runId": "phase4-public-pilot-04",
      "planHash": "fdc33d417de30a1aa48cc0711c89d87096bb2ad628b5d43f32046e9d0c16ef6a",
      "task": {
        "taskId": "public-fixture-discovery",
        "repositoryId": "public-fixture",
        "category": "discovery",
        "scenarioId": "deterministic-doc-bridge",
        "modelId": "reference-model",
        "replicate": 0,
        "variantId": "variant-a",
        "difficulty": "easy"
      },
      "model": {
        "id": "reference-model",
        "role": "reference",
        "provider": "codex",
        "model": "gpt-5.6-luna",
        "version": "codex-cli-0.154.0",
        "parametersHash": "785593a535c713ae8015defb031047fb9ae55926ec4ac0cb0cafcdaa5cba1e30",
        "contextLimit": 272000,
        "toolConfigurationHash": "d2fe8bbf1fa6add2b357c4a199a37224c03bbe4edf29901ff45ae0ef8ee99366",
        "promptContractHash": "5ba19f0e4ea57c4206d2965a55fc1bbd081348a8ccf89c86ff64a81df93bf98b"
      },
      "scenario": {
        "id": "deterministic-doc-bridge",
        "network": false
      },
      "execution": {
        "status": "completed",
        "exitCode": 0,
        "signal": null,
        "durationMs": 25737,
        "responseBytes": 457,
        "stderrBytes": 0,
        "stdoutHash": "baf21576255ae3f5f0eed25126697fe60382b8fb40f7f8b4443906bbb0013afb",
        "stderrHash": "e3b0c44298fc1c149afbf4c8996fb92427ae41e4649b934ca495991b7852b855",
        "inputTokens": 58289,
        "outputTokens": 1089,
        "tokenMethod": "provider",
        "toolCalls": 2
      },
      "contextBytes": 2493,
      "contextTokens": 624,
      "contextTokenMethod": "estimate",
      "evidenceIds": [
        "entrypoint-evidence"
      ],
      "round": "phase4-public-pilot-04",
      "taskOutcome": "partial",
      "evidenceQuality": "high",
      "safetyOutcome": "safe",
      "clarificationRequests": 0,
      "reworkCount": 0,
      "measurements": {
        "acceptanceChecksPassed": 0,
        "acceptanceChecksTotal": 1,
        "acceptanceChecksExecuted": 1,
        "entrypointEvidenceCount": 2,
        "ownershipEvidenceCount": 1,
        "cachedInputTokens": 36352,
        "reasoningOutputTokens": 589,
        "stderrBytes": 0,
        "providerTokenCostUnits": 59378
      },
      "adjudication": {
        "status": "automated",
        "actor": "deterministic-rubric-v1",
        "method": "deterministic-rubric-v1",
        "outcome": "partial",
        "reason": "Independent bounded evaluation of execution status, acceptance metrics, and exact required evidence coverage."
      },
      "contentHash": "efa346e73288cca9f86ccad77c10d978fa7525f880a21dd1dff80db49ee9c01d",
      "contentHashAlgo": "sha256-normalized-v1"
    },
    {
      "type": "controlled-study-observation",
      "schemaVersion": 1,
      "observationVersion": "v1",
      "observedAt": "2026-09-13T01:01:36.307Z",
      "runId": "phase4-public-pilot-04",
      "planHash": "fdc33d417de30a1aa48cc0711c89d87096bb2ad628b5d43f32046e9d0c16ef6a",
      "task": {
        "taskId": "public-fixture-architecture",
        "repositoryId": "public-fixture",
        "category": "architecture",
        "scenarioId": "deterministic-doc-bridge",
        "modelId": "low-cost-model",
        "replicate": 0,
        "variantId": "variant-b",
        "difficulty": "medium"
      },
      "model": {
        "id": "low-cost-model",
        "role": "low-cost",
        "provider": "codex",
        "model": "gpt-5.6-sol",
        "version": "codex-cli-0.154.0",
        "parametersHash": "6dc5481139cc4fc6960a38ffd4c7e68605108d0d3eac9ac3c269c92703200273",
        "contextLimit": 272000,
        "toolConfigurationHash": "a08b38a4fa7e559811713cabc2e2f62cb05ef266d406dcb38cf46be627417e20",
        "promptContractHash": "5ba19f0e4ea57c4206d2965a55fc1bbd081348a8ccf89c86ff64a81df93bf98b"
      },
      "scenario": {
        "id": "deterministic-doc-bridge",
        "network": false
      },
      "execution": {
        "status": "completed",
        "exitCode": 0,
        "signal": null,
        "durationMs": 37578,
        "responseBytes": 818,
        "stderrBytes": 0,
        "stdoutHash": "a98255fe0f953ca30df41e78b426b2bd0859cd902367da62f288fbfb90f18dc6",
        "stderrHash": "e3b0c44298fc1c149afbf4c8996fb92427ae41e4649b934ca495991b7852b855",
        "inputTokens": 62918,
        "outputTokens": 989,
        "tokenMethod": "provider",
        "toolCalls": 2
      },
      "contextBytes": 2592,
      "contextTokens": 648,
      "contextTokenMethod": "estimate",
      "evidenceIds": [
        "doc-bridge.config.json#corpus.agent",
        "doc-bridge.config.json#routing",
        "pnpm-workspace.yaml#packages",
        "packages/os-core/package.json#name",
        "docs/for-agents/INDEX.md",
        "docs/for-agents/packages/os-core.md",
        "fixture-architecture-check:exit-0"
      ],
      "round": "phase4-public-pilot-04",
      "taskOutcome": "success",
      "evidenceQuality": "high",
      "safetyOutcome": "safe",
      "clarificationRequests": 0,
      "reworkCount": 0,
      "measurements": {
        "acceptanceChecksPassed": 1,
        "acceptanceChecksTotal": 1,
        "acceptanceChecksExecuted": 1,
        "entrypointEvidenceCount": 1,
        "ownershipEvidenceCount": 2,
        "architectureRelationCount": 3,
        "documentationClaimEvidenceCount": 2,
        "sourceComparisonEvidenceCount": 3,
        "verificationEvidenceCount": 1,
        "errorRate": 0,
        "cachedInputTokens": 51712,
        "reasoningOutputTokens": 414,
        "stderrBytes": 0,
        "providerTokenCostUnits": 63907
      },
      "adjudication": {
        "status": "automated",
        "actor": "deterministic-rubric-v1",
        "method": "deterministic-rubric-v1",
        "outcome": "partial",
        "reason": "Independent bounded evaluation of execution status, acceptance metrics, and exact required evidence coverage."
      },
      "contentHash": "906e0db32d6b46331eb1b7422b6f1028073284290a42e18973e08c16370db5d0",
      "contentHashAlgo": "sha256-normalized-v1"
    },
    {
      "type": "controlled-study-observation",
      "schemaVersion": 1,
      "observationVersion": "v1",
      "observedAt": "2026-09-13T01:02:21.743Z",
      "runId": "phase4-public-pilot-04",
      "planHash": "fdc33d417de30a1aa48cc0711c89d87096bb2ad628b5d43f32046e9d0c16ef6a",
      "task": {
        "taskId": "public-fixture-implementation",
        "repositoryId": "public-fixture",
        "category": "implementation",
        "scenarioId": "repository-only",
        "modelId": "low-cost-model",
        "replicate": 0,
        "variantId": "variant-b",
        "difficulty": "hard"
      },
      "model": {
        "id": "low-cost-model",
        "role": "low-cost",
        "provider": "codex",
        "model": "gpt-5.6-sol",
        "version": "codex-cli-0.154.0",
        "parametersHash": "6dc5481139cc4fc6960a38ffd4c7e68605108d0d3eac9ac3c269c92703200273",
        "contextLimit": 272000,
        "toolConfigurationHash": "a08b38a4fa7e559811713cabc2e2f62cb05ef266d406dcb38cf46be627417e20",
        "promptContractHash": "5ba19f0e4ea57c4206d2965a55fc1bbd081348a8ccf89c86ff64a81df93bf98b"
      },
      "scenario": {
        "id": "repository-only",
        "network": false
      },
      "execution": {
        "status": "completed",
        "exitCode": 0,
        "signal": null,
        "durationMs": 45430,
        "responseBytes": 1262,
        "stderrBytes": 0,
        "stdoutHash": "c3e7e85723d39b8a02b8adf10c543c9ce77687c61c7cac52a6874a91ea7bd05b",
        "stderrHash": "e3b0c44298fc1c149afbf4c8996fb92427ae41e4649b934ca495991b7852b855",
        "inputTokens": 86251,
        "outputTokens": 1087,
        "tokenMethod": "provider",
        "toolCalls": 3
      },
      "contextBytes": 2724,
      "contextTokens": 681,
      "contextTokenMethod": "estimate",
      "evidenceIds": [
        "patch-evidence:docs/for-agents/INDEX.md lacks the package-routing link promised by its description; minimally add an os-core entry linking to docs/for-agents/packages/os-core.md and preserve the existing Markdown heading and concise prose conventions",
        "patch-evidence:.doc-bridge/index.json identifies docs/for-agents/INDEX.md as the find-package entrypoint and docs/for-agents/packages/os-core.md as the os-core agent document",
        "verification-plan:node -e \"const fs=require('node:fs'); if(!fs.existsSync('.doc-bridge/index.json')||!fs.existsSync('docs/for-agents/INDEX.md')) process.exit(1)\" completed successfully; review the proposed link target against .doc-bridge/index.json"
      ],
      "round": "phase4-public-pilot-04",
      "taskOutcome": "success",
      "evidenceQuality": "high",
      "safetyOutcome": "safe",
      "clarificationRequests": 0,
      "reworkCount": 0,
      "measurements": {
        "acceptanceChecksPassed": 1,
        "acceptanceChecksTotal": 1,
        "acceptanceChecksExecuted": 1,
        "entrypointEvidenceCount": 2,
        "ownershipEvidenceCount": 2,
        "documentationClaimEvidenceCount": 1,
        "sourceComparisonEvidenceCount": 2,
        "verificationEvidenceCount": 1,
        "errorRate": 0,
        "documentationFindingCount": 1,
        "cachedInputTokens": 78976,
        "reasoningOutputTokens": 288,
        "stderrBytes": 0,
        "providerTokenCostUnits": 87338
      },
      "adjudication": {
        "status": "automated",
        "actor": "deterministic-rubric-v1",
        "method": "deterministic-rubric-v1",
        "outcome": "partial",
        "reason": "Independent bounded evaluation of execution status, acceptance metrics, and exact required evidence coverage."
      },
      "contentHash": "2fe6c04fed3981383228a2e3912b2f326df520745cb123d2c56b2814243a0165",
      "contentHashAlgo": "sha256-normalized-v1"
    },
    {
      "type": "controlled-study-observation",
      "schemaVersion": 1,
      "observationVersion": "v1",
      "observedAt": "2026-09-13T01:02:45.775Z",
      "runId": "phase4-public-pilot-04",
      "planHash": "fdc33d417de30a1aa48cc0711c89d87096bb2ad628b5d43f32046e9d0c16ef6a",
      "task": {
        "taskId": "public-fixture-architecture",
        "repositoryId": "public-fixture",
        "category": "architecture",
        "scenarioId": "repository-only",
        "modelId": "reference-model",
        "replicate": 0,
        "variantId": "variant-a",
        "difficulty": "medium"
      },
      "model": {
        "id": "reference-model",
        "role": "reference",
        "provider": "codex",
        "model": "gpt-5.6-luna",
        "version": "codex-cli-0.154.0",
        "parametersHash": "785593a535c713ae8015defb031047fb9ae55926ec4ac0cb0cafcdaa5cba1e30",
        "contextLimit": 272000,
        "toolConfigurationHash": "d2fe8bbf1fa6add2b357c4a199a37224c03bbe4edf29901ff45ae0ef8ee99366",
        "promptContractHash": "5ba19f0e4ea57c4206d2965a55fc1bbd081348a8ccf89c86ff64a81df93bf98b"
      },
      "scenario": {
        "id": "repository-only",
        "network": false
      },
      "execution": {
        "status": "completed",
        "exitCode": 0,
        "signal": null,
        "durationMs": 24027,
        "responseBytes": 520,
        "stderrBytes": 0,
        "stdoutHash": "751c2179827e0ccb51bf708547184ab5d2d04d2a38f5f534e07f5cf73366294b",
        "stderrHash": "e3b0c44298fc1c149afbf4c8996fb92427ae41e4649b934ca495991b7852b855",
        "inputTokens": 58594,
        "outputTokens": 990,
        "tokenMethod": "provider",
        "toolCalls": 2
      },
      "contextBytes": 2584,
      "contextTokens": 646,
      "contextTokenMethod": "estimate",
      "evidenceIds": [
        "architecture-evidence",
        "fixture-architecture-check"
      ],
      "round": "phase4-public-pilot-04",
      "taskOutcome": "incomplete",
      "evidenceQuality": "high",
      "safetyOutcome": "safe",
      "clarificationRequests": 1,
      "reworkCount": 0,
      "measurements": {
        "acceptanceChecksPassed": 1,
        "acceptanceChecksTotal": 1,
        "acceptanceChecksExecuted": 1,
        "entrypointEvidenceCount": 1,
        "ownershipEvidenceCount": 1,
        "architectureRelationCount": 2,
        "cachedInputTokens": 37376,
        "reasoningOutputTokens": 507,
        "stderrBytes": 0,
        "providerTokenCostUnits": 59584
      },
      "adjudication": {
        "status": "automated",
        "actor": "deterministic-rubric-v1",
        "method": "deterministic-rubric-v1",
        "outcome": "success",
        "reason": "Independent bounded evaluation of execution status, acceptance metrics, and exact required evidence coverage."
      },
      "contentHash": "dcb5e618e289249facff7422dd6e598f76640095f93ddc7226e52384fac4e5dc",
      "contentHashAlgo": "sha256-normalized-v1"
    },
    {
      "type": "controlled-study-observation",
      "schemaVersion": 1,
      "observationVersion": "v1",
      "observedAt": "2026-09-13T01:03:22.869Z",
      "runId": "phase4-public-pilot-04",
      "planHash": "fdc33d417de30a1aa48cc0711c89d87096bb2ad628b5d43f32046e9d0c16ef6a",
      "task": {
        "taskId": "public-fixture-discovery",
        "repositoryId": "public-fixture",
        "category": "discovery",
        "scenarioId": "repository-only",
        "modelId": "reference-model",
        "replicate": 0,
        "variantId": "variant-b",
        "difficulty": "easy"
      },
      "model": {
        "id": "reference-model",
        "role": "reference",
        "provider": "codex",
        "model": "gpt-5.6-luna",
        "version": "codex-cli-0.154.0",
        "parametersHash": "785593a535c713ae8015defb031047fb9ae55926ec4ac0cb0cafcdaa5cba1e30",
        "contextLimit": 272000,
        "toolConfigurationHash": "d2fe8bbf1fa6add2b357c4a199a37224c03bbe4edf29901ff45ae0ef8ee99366",
        "promptContractHash": "5ba19f0e4ea57c4206d2965a55fc1bbd081348a8ccf89c86ff64a81df93bf98b"
      },
      "scenario": {
        "id": "repository-only",
        "network": false
      },
      "execution": {
        "status": "completed",
        "exitCode": 0,
        "signal": null,
        "durationMs": 37091,
        "responseBytes": 549,
        "stderrBytes": 0,
        "stdoutHash": "3833ac2f0a74d07b466f426a9b98f82d644a38f69895317fb91e47cdda2fc47a",
        "stderrHash": "e3b0c44298fc1c149afbf4c8996fb92427ae41e4649b934ca495991b7852b855",
        "inputTokens": 99989,
        "outputTokens": 1403,
        "tokenMethod": "provider",
        "toolCalls": 4
      },
      "contextBytes": 2484,
      "contextTokens": 621,
      "contextTokenMethod": "estimate",
      "evidenceIds": [
        "entrypoint-evidence",
        "fixture-discovery-check"
      ],
      "round": "phase4-public-pilot-04",
      "taskOutcome": "success",
      "evidenceQuality": "high",
      "safetyOutcome": "safe",
      "clarificationRequests": 0,
      "reworkCount": 0,
      "measurements": {
        "acceptanceChecksPassed": 1,
        "acceptanceChecksTotal": 1,
        "acceptanceChecksExecuted": 1,
        "entrypointEvidenceCount": 1,
        "ownershipEvidenceCount": 1,
        "documentationClaimEvidenceCount": 1,
        "verificationEvidenceCount": 1,
        "cachedInputTokens": 76800,
        "reasoningOutputTokens": 709,
        "stderrBytes": 0,
        "providerTokenCostUnits": 101392
      },
      "adjudication": {
        "status": "automated",
        "actor": "deterministic-rubric-v1",
        "method": "deterministic-rubric-v1",
        "outcome": "success",
        "reason": "Independent bounded evaluation of execution status, acceptance metrics, and exact required evidence coverage."
      },
      "contentHash": "d9d8a5e9ee09306ed1cda4cccd0a95aa04d9b4309a2ddd7b16e341319937c5f0",
      "contentHashAlgo": "sha256-normalized-v1"
    },
    {
      "type": "controlled-study-observation",
      "schemaVersion": 1,
      "observationVersion": "v1",
      "observedAt": "2026-09-13T01:03:58.593Z",
      "runId": "phase4-public-pilot-04",
      "planHash": "fdc33d417de30a1aa48cc0711c89d87096bb2ad628b5d43f32046e9d0c16ef6a",
      "task": {
        "taskId": "public-fixture-discovery",
        "repositoryId": "public-fixture",
        "category": "discovery",
        "scenarioId": "deterministic-doc-bridge",
        "modelId": "low-cost-model",
        "replicate": 0,
        "variantId": "variant-b",
        "difficulty": "easy"
      },
      "model": {
        "id": "low-cost-model",
        "role": "low-cost",
        "provider": "codex",
        "model": "gpt-5.6-sol",
        "version": "codex-cli-0.154.0",
        "parametersHash": "6dc5481139cc4fc6960a38ffd4c7e68605108d0d3eac9ac3c269c92703200273",
        "contextLimit": 272000,
        "toolConfigurationHash": "a08b38a4fa7e559811713cabc2e2f62cb05ef266d406dcb38cf46be627417e20",
        "promptContractHash": "5ba19f0e4ea57c4206d2965a55fc1bbd081348a8ccf89c86ff64a81df93bf98b"
      },
      "scenario": {
        "id": "deterministic-doc-bridge",
        "network": false
      },
      "execution": {
        "status": "completed",
        "exitCode": 0,
        "signal": null,
        "durationMs": 35720,
        "responseBytes": 488,
        "stderrBytes": 0,
        "stdoutHash": "9fbdbafd0d60c61a3fb28a92bb0d2c5dfda4c86c70809804de6c3ca12440b653",
        "stderrHash": "e3b0c44298fc1c149afbf4c8996fb92427ae41e4649b934ca495991b7852b855",
        "inputTokens": 106403,
        "outputTokens": 1299,
        "tokenMethod": "provider",
        "toolCalls": 4
      },
      "contextBytes": 2492,
      "contextTokens": 623,
      "contextTokenMethod": "estimate",
      "evidenceIds": [
        "entrypoint-evidence"
      ],
      "round": "phase4-public-pilot-04",
      "taskOutcome": "success",
      "evidenceQuality": "high",
      "safetyOutcome": "safe",
      "clarificationRequests": 0,
      "reworkCount": 1,
      "measurements": {
        "acceptanceChecksPassed": 1,
        "acceptanceChecksTotal": 1,
        "acceptanceChecksExecuted": 1,
        "entrypointEvidenceCount": 2,
        "ownershipEvidenceCount": 2,
        "verificationEvidenceCount": 1,
        "cachedInputTokens": 83712,
        "reasoningOutputTokens": 515,
        "stderrBytes": 0,
        "providerTokenCostUnits": 107702
      },
      "adjudication": {
        "status": "automated",
        "actor": "deterministic-rubric-v1",
        "method": "deterministic-rubric-v1",
        "outcome": "success",
        "reason": "Independent bounded evaluation of execution status, acceptance metrics, and exact required evidence coverage."
      },
      "contentHash": "017798c0836db6dfc4cef92ccf216def5b25c5f36658dc304a6b81eeb8637dea",
      "contentHashAlgo": "sha256-normalized-v1"
    }
  ],
  "contentHash": "1cde4be16c44f15ad28fa9f3d7089aef8f2c9f98d7ba847287f125678718b659",
  "contentHashAlgo": "sha256-normalized-v1"
}
