<rss xmlns:atom="http://www.w3.org/2005/Atom" version="2.0"><channel><title>CUDA - Tag - 枕石的个人博客</title><link>https://blog.zsmgc.love/tags/cuda/</link><description>CUDA - Tag - 枕石的个人博客</description><generator>Hugo -- gohugo.io</generator><language>zh-CN</language><managingEditor>3499129952@qq.com (枕石)</managingEditor><webMaster>3499129952@qq.com (枕石)</webMaster><lastBuildDate>Fri, 10 Jul 2026 00:30:00 +0800</lastBuildDate><atom:link href="https://blog.zsmgc.love/tags/cuda/" rel="self" type="application/rss+xml"/><item><title>MiniPaged-Qwen：把 Paged Attention 讲清楚</title><link>https://blog.zsmgc.love/posts/minipaged_qwen_paged_attention/</link><pubDate>Fri, 10 Jul 2026 00:30:00 +0800</pubDate><author>枕石</author><guid>https://blog.zsmgc.love/posts/minipaged_qwen_paged_attention/</guid><description>&lt;p>大模型推理里，大家一提优化，最容易先想到的是 FlashAttention、Tensor Core、Kernel Fusion。但在实际的 &lt;strong>LLM Serving&lt;/strong> 场景里，另一个同样关键的问题往往更“系统”一些：&lt;/p></description></item><item><title>MiniPaged-Qwen：Paged KV Cache 与 KV Block Manager</title><link>https://blog.zsmgc.love/posts/minipaged_qwen_paged_kv_cache/</link><pubDate>Thu, 09 Jul 2026 22:00:00 +0800</pubDate><author>枕石</author><guid>https://blog.zsmgc.love/posts/minipaged_qwen_paged_kv_cache/</guid><description>&lt;p>大模型推理中，Attention 的计算优化只是问题的一部分。进入 Decode 阶段以后，另一个越来越重要的问题是：&lt;strong>历史 Token 的 Key 和 Value 应该放在哪里，又应该怎样管理？&lt;/strong>&lt;/p></description></item><item><title>MiniPaged-Qwen：面向 Qwen3 推理的 Prefill FlashAttention</title><link>https://blog.zsmgc.love/posts/minipaged_qwen_qwen3_prefill_flashattention/</link><pubDate>Wed, 08 Jul 2026 21:00:00 +0800</pubDate><author>枕石</author><guid>https://blog.zsmgc.love/posts/minipaged_qwen_qwen3_prefill_flashattention/</guid><description><![CDATA[<p>在大模型推理中，用户输入一段 Prompt 后，模型并不是立即进入逐 Token 生成。完整推理通常可以分成两个阶段：<strong>Prefill</strong> 和 <strong>Decode</strong>。</p>
<p>Prefill 一次处理整段 Prompt，拥有较长的 Query 序列，Attention 更接近矩阵乘法；Decode 每一步通常只有一个 Query Token，却需要不断读取增长的历史 KV Cache。两者虽然都在计算 Attention，但计算形态和优化重点完全不同。</p>]]></description></item><item><title>CUDA编程基础</title><link>https://blog.zsmgc.love/posts/cuda%E7%BC%96%E7%A8%8B%E5%9F%BA%E7%A1%80/</link><pubDate>Sun, 24 May 2026 22:57:20 +0800</pubDate><author>枕石</author><guid>https://blog.zsmgc.love/posts/cuda%E7%BC%96%E7%A8%8B%E5%9F%BA%E7%A1%80/</guid><description><![CDATA[<blockquote>
<p>CUDA（Compute Unified Device Architecture）是 NVIDIA 推出的并行计算平台和编程模型。它允许程序员使用类似 C/C++ 的语法编写在 GPU 上运行的函数，将同一项计算分配给大量线程并行完成。本文不会只罗列 CUDA API，而是沿着“<strong>GPU 硬件 → CUDA 线程模型 → Kernel 调度 → 内存层次 → 基础优化</strong>”这条主线，建立一个完整的 CUDA 编程认知。</p>]]></description></item></channel></rss>