guidellm.data.builders
PromptTooShortError
process_dataset(data, output_path, tokenizer, strategy, data_column_mapper, push_to_hub, hub_dataset_id, random_seed, data_loader=None)
Main method to process and save a dataset with sampled prompt/output token counts.
Parameters:
| Name | Type | Description | Default |
|---|---|---|---|
data_loader | DataLoaderArgs | None | Optional loader config. When | None |
Source code in src/guidellm/data/builders.py
push_dataset_to_hub(hub_dataset_id, processed_dataset)
Pushes the processed dataset to Hugging Face Hub using HF_TOKEN.
Parameters:
| Name | Type | Description | Default |
|---|---|---|---|
hub_dataset_id | str | None | Identifier on the Hub to push to. | required |
processed_dataset | Dataset | HuggingFace Dataset object. | required |
Raises:
| Type | Description |
|---|---|
ValueError | If hub_dataset_id or HF_TOKEN is not available. |