llama.cpp
26c9ce12 - server: Add cached_tokens info to oaicompat responses (#19361)

Commit
135 days ago
server: Add cached_tokens info to oaicompat responses (#19361) * tests : fix fetch_server_test_models.py * server: to_json_oaicompat cached_tokens Adds OpenAI and Anthropic compatible information about the number of cached prompt tokens used in a response.
Author
Parents
Loading