<rss xmlns:atom="http://www.w3.org/2005/Atom" version="2.0"><channel><title>FlashAttention - Tag - 枕石的个人博客</title><link>https://blog.zsmgc.love/tags/flashattention/</link><description>FlashAttention - Tag - 枕石的个人博客</description><generator>Hugo -- gohugo.io</generator><language>zh-CN</language><managingEditor>3499129952@qq.com (枕石)</managingEditor><webMaster>3499129952@qq.com (枕石)</webMaster><lastBuildDate>Wed, 08 Jul 2026 21:00:00 +0800</lastBuildDate><atom:link href="https://blog.zsmgc.love/tags/flashattention/" rel="self" type="application/rss+xml"/><item><title>MiniPaged-Qwen：面向 Qwen3 推理的 Prefill FlashAttention</title><link>https://blog.zsmgc.love/posts/minipaged_qwen_qwen3_prefill_flashattention/</link><pubDate>Wed, 08 Jul 2026 21:00:00 +0800</pubDate><author>枕石</author><guid>https://blog.zsmgc.love/posts/minipaged_qwen_qwen3_prefill_flashattention/</guid><description><![CDATA[<p>在大模型推理中，用户输入一段 Prompt 后，模型并不是立即进入逐 Token 生成。完整推理通常可以分成两个阶段：<strong>Prefill</strong> 和 <strong>Decode</strong>。</p>
<p>Prefill 一次处理整段 Prompt，拥有较长的 Query 序列，Attention 更接近矩阵乘法；Decode 每一步通常只有一个 Query Token，却需要不断读取增长的历史 KV Cache。两者虽然都在计算 Attention，但计算形态和优化重点完全不同。</p>]]></description></item></channel></rss>