<rss xmlns:atom="http://www.w3.org/2005/Atom" version="2.0"><channel><title>LLM推理 - Category - 枕石的个人博客</title><link>https://blog.zsmgc.love/categories/llm%E6%8E%A8%E7%90%86/</link><description>LLM推理 - Category - 枕石的个人博客</description><generator>Hugo -- gohugo.io</generator><language>zh-CN</language><managingEditor>3499129952@qq.com (枕石)</managingEditor><webMaster>3499129952@qq.com (枕石)</webMaster><lastBuildDate>Fri, 10 Jul 2026 10:00:00 +0800</lastBuildDate><atom:link href="https://blog.zsmgc.love/categories/llm%E6%8E%A8%E7%90%86/" rel="self" type="application/rss+xml"/><item><title>Qwen3 推理过程：从输入文本到下一个 Token</title><link>https://blog.zsmgc.love/posts/qwen3_inference_architecture/</link><pubDate>Fri, 10 Jul 2026 10:00:00 +0800</pubDate><author>枕石</author><guid>https://blog.zsmgc.love/posts/qwen3_inference_architecture/</guid><description>&lt;p>前面在分析 FlashAttention、Paged KV Cache 和 Paged Attention 时，我一直在研究 Qwen3 推理过程中的局部模块：Attention 是怎么计算的、KV Cache 为什么要保存、Decode 为什么需要分页访问历史 KV。把这些模块单独拆开以后，反而容易丢掉一个更基础的问题：&lt;strong>一个输入句子究竟是怎样经过 Qwen3，最后变成下一个 Token 的？&lt;/strong>&lt;/p></description></item><item><title>MiniPaged-Qwen：把 Paged Attention 讲清楚</title><link>https://blog.zsmgc.love/posts/minipaged_qwen_paged_attention/</link><pubDate>Fri, 10 Jul 2026 00:30:00 +0800</pubDate><author>枕石</author><guid>https://blog.zsmgc.love/posts/minipaged_qwen_paged_attention/</guid><description>&lt;p>大模型推理里，大家一提优化，最容易先想到的是 FlashAttention、Tensor Core、Kernel Fusion。但在实际的 &lt;strong>LLM Serving&lt;/strong> 场景里，另一个同样关键的问题往往更“系统”一些：&lt;/p></description></item><item><title>MiniPaged-Qwen：Paged KV Cache 与 KV Block Manager</title><link>https://blog.zsmgc.love/posts/minipaged_qwen_paged_kv_cache/</link><pubDate>Thu, 09 Jul 2026 22:00:00 +0800</pubDate><author>枕石</author><guid>https://blog.zsmgc.love/posts/minipaged_qwen_paged_kv_cache/</guid><description>&lt;p>大模型推理中，Attention 的计算优化只是问题的一部分。进入 Decode 阶段以后，另一个越来越重要的问题是：&lt;strong>历史 Token 的 Key 和 Value 应该放在哪里，又应该怎样管理？&lt;/strong>&lt;/p></description></item></channel></rss>