GitHub - 0xBakeer/TandemLLM: Inference engine for Qwen3.8-27B on one DGX Spark: speculative draft...
Inference engine for Qwen3.8-27B on one DGX Spark: speculative draft trees sized by StairCut, NVFP4 kernels, exact recurrent-state caches - 0xBakeer/TandemLLM
github.com