LLM speculative inference server for consumer & heterogeneous hardware
spark kernel cuda cuda-kernels rocm heterogeneous-computing luce poolside rtx3090 llama-cpp local-ai qwen speculative-decoding strix-halo dflash megakernel speculative-prefill pflash r9700
-
Updated
Aug 13, 2026 - C++