feat: add per-model inference provider selection
Allow users to select their preferred inference provider per model with
options including:
- Auto (respects user's HuggingFace preference order)
- Fastest (highest throughput provider)
- Cheapest (lowest cost per output token)
- Specific providers (together, sambanova, etc.)
The provider preference is appended to the model ID when making inference
requests (e.g., "model:fastest") following HuggingFace's documented API.
Router models (Omni) are excluded from this feature as they handle their
own intelligent routing.
Changes:
- Add providerOverrides setting (Record<string, string>) to user settings
- Add provider dropdown UI on model settings page (hidden for router models)
- Pass provider preference through text generation pipeline
- Support provider suffix in both regular endpoint and MCP tool flow
https://claude.ai/code/session_016q6bhcJrusLKVMLq6x739B