Engine-level metrics like speculative decoding acceptance length and per-replica token latency quantiles are provided
Originalauszug
We don't hide the metrics . The metrics you actually need to debug inference issues, like speculative decoding acceptance length and per-replica, engine-side token latency quantiles, are automatically provided in a dashboard. Low bar, but we didn't put it there!