guidellm.backends.vllm_python.vllm_response
VLLM-specific response handler for building GenerationResponse from vLLM output.
Builds GenerationResponse from text and usage dicts extracted directly from vLLM's RequestOutput — no OpenAI-format intermediary.
VLLMResponseHandler
Stateless response builder for the vLLM Python backend.
Converts (text, usage dict) pairs into GenerationResponse with proper UsageMetrics. All methods are static; no per-request accumulation state.
Source code in src/guidellm/backends/vllm_python/vllm_response.py
build_response(request, text, usage, response_id=None) staticmethod
Build a GenerationResponse from text and usage extracted from vLLM output.
Parameters:
| Name | Type | Description | Default |
|---|---|---|---|
request | GenerationRequest | Original generation request (provides request_id) | required |
text | str | Generated text | required |
usage | dict[str, int] | None | Token usage dict (prompt_tokens, completion_tokens, total_tokens) | required |
response_id | str | None | Optional response/request ID from vLLM | None |
Returns:
| Type | Description |
|---|---|
GenerationResponse | GenerationResponse with text and metrics |