/** * Inference scheduling benchmark harness (3.0.0 foundation). * * Synthetic-backend benchmark over the real SharedInferenceScheduler. It * measures scheduling behavior (queue latency, TTFT, busy-slot utilization, * avoidable idle) independently of real Qwen. Real-Qwen measurements are a * separate QA artifact; synthetic capacity profiles are labeled as such. */ export interface InferenceSchedulerBenchmarkOptions { capacity: number; agentCount: number; requestsPerAgent: number; /** Synthetic generation wall time per request. */ generationMs: number; /** Synthetic tool time between an agent's sequential requests. */ toolMs?: number; /** Deterministic queue-wait deadline (0 = unbounded). */ queueWaitTimeoutMs?: number; } export interface InferenceSchedulerBenchmarkResult { profile: { backend: "synthetic"; capacity: number; agentCount: number; requestsPerAgent: number; generationMs: number; toolMs: number; }; requestCount: number; queueWaitMs: { p50: number; p95: number; max: number; }; ttftMs: { p50: number; p95: number; max: number; }; perRequestDecodeTokensPerSec: { p50: number; p95: number; }; aggregateModelTokensPerSec: number; busySlotPercent: number; avoidableIdleMs: number; totalWallMs: number; completedCount: number; failedCount: number; } /** * Run a synthetic concurrency-profile benchmark. Each logical agent issues * `requestsPerAgent` sequential generations through the scheduler (capacity * `capacity`). All agents run concurrently, so queueing emerges naturally. */ export declare function runInferenceSchedulerBenchmark(options: InferenceSchedulerBenchmarkOptions): Promise; //# sourceMappingURL=benchmark.d.ts.map