Files
llama.cpp/ggml/src
ynankani 25ae3a9b33 CUDA: MMVQ nwarps=8 for bs=1 for dense models on DGX Spark (#26843)
* CUDA: MMVQ nwarps=8 for bs=1 for dense models on DGX Spark

Signed-off-by: ynankani <[email protected]>

* skip moe experts and allow others based on k geometry (allow only small idle tail)

Signed-off-by: ynankani <[email protected]>

* rename MMVQ DGX Spark params to GB10 and fix MSVC constexpr lambda capture

Signed-off-by: ynankani <[email protected]>

---------

Signed-off-by: ynankani <[email protected]>
2026-08-18 09:45:53 +05:30
..
2026-04-16 17:21:28 +08:00