<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/">
  <channel>
    <title>显存优化 on Jiaqi</title>
    <link>https://blog.jiaqiguo.xyz/tags/%E6%98%BE%E5%AD%98%E4%BC%98%E5%8C%96/</link>
    <description>Recent content in 显存优化 on Jiaqi</description>
    <generator>Hugo</generator>
    <language>zh-cn</language>
    <lastBuildDate>Thu, 06 Aug 2026 16:30:00 +0800</lastBuildDate>
    <atom:link href="https://blog.jiaqiguo.xyz/tags/%E6%98%BE%E5%AD%98%E4%BC%98%E5%8C%96/index.xml" rel="self" type="application/rss+xml" />
    <item>
      <title>最贵的一层：深入浅出 Liger Kernel 与 Cut Cross-Entropy</title>
      <link>https://blog.jiaqiguo.xyz/posts/liger-cce/</link>
      <pubDate>Thu, 06 Aug 2026 16:30:00 +0800</pubDate>
      <guid>https://blog.jiaqiguo.xyz/posts/liger-cce/</guid>
      <description>微调一个 2B 小模型也能 OOM？大词表时代，显存大头不是权重也不是注意力，而是交叉熵前那个「几万 token × 几十万词表」的 logits 矩阵，还一物多份。拆解两把砍掉它的刀——Liger Kernel 的分块融合 FLCE 与 Apple 的 Cut Cross-Entropy，附实操代码、一版讲透 use_reentrant 的纯 PyTorch 手写实现，以及昇腾 NPU 支持现状。</description>
    </item>
  </channel>
</rss>
