Fusing a 27B ternary LLM's whole decode step into one CUDA kernel #1 Post by Jr23_xd » Thu, Jul 16, 2026, 12:39 AM UTC Fusing a 27B ternary LLM's whole decode step into one CUDA kerneltwitter.com
Re: Fusing a 27B ternary LLM's whole decode step into one CUDA kernel #2 Post by genxy » Thu, Jul 16, 2026, 5:00 AM UTC [dead]