mirror of
https://github.com/ggml-org/llama.cpp.git
synced 2026-08-12 22:31:11 +04:00
metrics_flush_idle
This commit is contained in:
@@ -2703,6 +2703,9 @@ private:
|
||||
|
||||
if (all_idle) {
|
||||
SRV_TRC("%s", "all slots are idle\n");
|
||||
|
||||
metrics_flush_idle();
|
||||
|
||||
return; // skip further processing
|
||||
|
||||
} else {
|
||||
@@ -3922,6 +3925,16 @@ private:
|
||||
}
|
||||
}
|
||||
|
||||
// flush any queued prompt metrics if all slots are now idle
|
||||
void metrics_flush_idle() {
|
||||
if (metrics.n_prompt_queued == 0) {
|
||||
return;
|
||||
}
|
||||
|
||||
llama_synchronize(ctx_tgt);
|
||||
metrics.flush_prompt();
|
||||
}
|
||||
|
||||
void metrics_on_prediction(const server_slot & slot) {
|
||||
const uint64_t t_us = slot.stats.t_gen_us();
|
||||
const uint64_t n = slot.stats.n_gen;
|
||||
|
||||
Reference in New Issue
Block a user