From 6b1b43fe9d9d524232677e15879f83ec43d90d9e Mon Sep 17 00:00:00 2001 From: Kawrakow Date: Sun, 2 Aug 2026 16:24:04 +0000 Subject: [PATCH] Allow K to be f32 in ggml_cuda_op_indexer_topk --- ggml/src/ggml-cuda/indexer_topk.cu | 3 ++- 1 file changed, 2 insertions(+), 1 deletion(-) diff --git a/ggml/src/ggml-cuda/indexer_topk.cu b/ggml/src/ggml-cuda/indexer_topk.cu index 523ff5566..0bdd7ea8b 100644 --- a/ggml/src/ggml-cuda/indexer_topk.cu +++ b/ggml/src/ggml-cuda/indexer_topk.cu @@ -69,7 +69,8 @@ void ggml_cuda_op_indexer_topk(ggml_backend_cuda_context & ctx, ggml_tensor * ds int n_top_k = dst->ne[0]; int n_kv = k->ne[1]; int n_head = q->ne[1]; - GGML_ASSERT(k->type == GGML_TYPE_F16 || ggml_is_quantized(k->type)); + //if (k->type != GGML_TYPE_F16 && !ggml_is_quantized(k->type)) printf("%s: K is %s?\n", __func__, ggml_type_name(k->type)); + GGML_ASSERT(k->type == GGML_TYPE_F16 || k->type == GGML_TYPE_F32 || ggml_is_quantized(k->type)); GGML_ASSERT(k->ne[2] == 1 || k->ne[3] == 1); GGML_ASSERT(k->ne[1] > n_top_k); GGML_ASSERT(k->ne[1] == m->ne[0]);