Q8 KV cache lets a 30B model fit 100K context on a 24 GB RTX 5090 #1 Post by bozdemir » Wed, May 06, 2026, 7:48 AM UTC Q8 KV cache lets a 30B model fit 100K context on a 24 GB RTX 5090buraak.com