Strata 是一个基于 llama.cpp/ggml 构建的开源本地推理引擎,通过 MoE 专家分层缓存(GPU→RAM→SSD)和猜测-验证投机解码,让 12GB 显存的消费级显卡也能运行 Qwen3.8-Flash-Next 1250 亿参数模型,生成速度达 53-94 tokens/秒。