<rss xmlns:atom="http://www.w3.org/2005/Atom" version="2.0"><channel><title>LLM - Tag - 枕石的个人博客</title><link>https://blog.zsmgc.love/tags/llm/</link><description>LLM - Tag - 枕石的个人博客</description><generator>Hugo -- gohugo.io</generator><language>zh-CN</language><managingEditor>3499129952@qq.com (枕石)</managingEditor><webMaster>3499129952@qq.com (枕石)</webMaster><lastBuildDate>Fri, 10 Jul 2026 10:00:00 +0800</lastBuildDate><atom:link href="https://blog.zsmgc.love/tags/llm/" rel="self" type="application/rss+xml"/><item><title>Qwen3 推理过程：从输入文本到下一个 Token</title><link>https://blog.zsmgc.love/posts/qwen3_inference_architecture/</link><pubDate>Fri, 10 Jul 2026 10:00:00 +0800</pubDate><author>枕石</author><guid>https://blog.zsmgc.love/posts/qwen3_inference_architecture/</guid><description>&lt;p>前面在分析 FlashAttention、Paged KV Cache 和 Paged Attention 时，我一直在研究 Qwen3 推理过程中的局部模块：Attention 是怎么计算的、KV Cache 为什么要保存、Decode 为什么需要分页访问历史 KV。把这些模块单独拆开以后，反而容易丢掉一个更基础的问题：&lt;strong>一个输入句子究竟是怎样经过 Qwen3，最后变成下一个 Token 的？&lt;/strong>&lt;/p></description></item><item><title>MiniPaged-Qwen：把 Paged Attention 讲清楚</title><link>https://blog.zsmgc.love/posts/minipaged_qwen_paged_attention/</link><pubDate>Fri, 10 Jul 2026 00:30:00 +0800</pubDate><author>枕石</author><guid>https://blog.zsmgc.love/posts/minipaged_qwen_paged_attention/</guid><description>&lt;p>大模型推理里，大家一提优化，最容易先想到的是 FlashAttention、Tensor Core、Kernel Fusion。但在实际的 &lt;strong>LLM Serving&lt;/strong> 场景里，另一个同样关键的问题往往更“系统”一些：&lt;/p></description></item><item><title>MiniPaged-Qwen：Paged KV Cache 与 KV Block Manager</title><link>https://blog.zsmgc.love/posts/minipaged_qwen_paged_kv_cache/</link><pubDate>Thu, 09 Jul 2026 22:00:00 +0800</pubDate><author>枕石</author><guid>https://blog.zsmgc.love/posts/minipaged_qwen_paged_kv_cache/</guid><description>&lt;p>大模型推理中，Attention 的计算优化只是问题的一部分。进入 Decode 阶段以后，另一个越来越重要的问题是：&lt;strong>历史 Token 的 Key 和 Value 应该放在哪里，又应该怎样管理？&lt;/strong>&lt;/p></description></item><item><title>MiniPaged-Qwen：面向 Qwen3 推理的 Prefill FlashAttention</title><link>https://blog.zsmgc.love/posts/minipaged_qwen_qwen3_prefill_flashattention/</link><pubDate>Wed, 08 Jul 2026 21:00:00 +0800</pubDate><author>枕石</author><guid>https://blog.zsmgc.love/posts/minipaged_qwen_qwen3_prefill_flashattention/</guid><description><![CDATA[<p>在大模型推理中，用户输入一段 Prompt 后，模型并不是立即进入逐 Token 生成。完整推理通常可以分成两个阶段：<strong>Prefill</strong> 和 <strong>Decode</strong>。</p>
<p>Prefill 一次处理整段 Prompt，拥有较长的 Query 序列，Attention 更接近矩阵乘法；Decode 每一步通常只有一个 Query Token，却需要不断读取增长的历史 KV Cache。两者虽然都在计算 Attention，但计算形态和优化重点完全不同。</p>]]></description></item></channel></rss>