减薄与键合:芯片要减掉 99.8% 的厚度,这一步为什么比光刻更难
一、六十年来,制程第一次要做减法
六十年的半导体制程,动作基本都是往上加。光刻把图形印上去,沉积把膜长上去,刻蚀虽然叫“刻”,留下的还是精心设计过的结构。整条产线在加法上已经熟练到极致,一套图形能在几百道工序里层层叠上去,累积误差还压在几个纳米以内。
背面供电逼着产线做了一次近乎彻底的减法。
一片 300mm 硅晶圆出厂时厚 775 微米。要做背面供电,这个数得先减到 1 到 3 微米,减掉 99.8%。imec 那套埋入电源轨方案更极端,最后只剩 350 纳米的硅外延帽层,下面垫 50 纳米的硅锗,剩余厚度大约 400 纳米,减掉 99.95%。
把 775 微米减到 400 纳米,这张图是整篇文章的起点
这两个数单看确实唬人,但它们只是结果。我翻这一轮材料时觉得反常的,是它的动作顺序。
要减薄,得先粘。
二、三个约束,指向同一个动作
最直接的一条约束是够不着。背面供电的垂直通路是纳米硅通孔,它得从晶圆背面往上穿,一直落到晶体管的源极和漏极上。硅留得越厚,孔就越深。这类通孔的直径目前在 100 到 200 纳米之间,深宽比要做到 10:1 左右,孔壁还得平整、填充不能有空洞。硅还是 775 微米的时候,这颗孔根本无从谈起。
比它更麻烦的是电阻。通孔不是理想导线,它自己就带电阻,而这条电阻的大小基本由长度决定。它串在供电回路上,长度就是压降的一部分。减薄到只剩几百纳米,图的就是把这一项压到可以忽略。Arm 和 imec 的仿真与工艺研究给过一个对比数字:通孔间距小于 2 微米时,背面供电网络的效率是正面网络的 7 倍。
还有一条关于距离。供电回路越短,电阻和压降就越小。英特尔把这项收益量化为最坏情况动态电压跌落改善约 10 倍、IR 压降最多降低 30%。
三条约束从三个方向指过来,落点是同一个动作。
imec 的项目总监詹姆斯·迈尔斯把这套配套难题讲得更完整。他列了三件必须同时成立的事:把硅衬底几乎完全移除,才能从背面接触到器件,而这要求先把做完前道工序的晶圆正面键合到另一片载片上,再研磨或抛光背面,并且整片范围都要磨得均匀,给后面的光刻留下一块平整的起始面;背面金属层要对准正面的源漏接触点,同时不能碰到中间的沟道和栅极,这需要严格控制背面光刻的套刻;最后是在热预算受限的前提下做出低阻接触,因为晶圆正面已经铺好了铜互连,高温会把它毁掉。
他这段话里,“键合”是作为减薄的前提条件出现的。这不是表述顺序的问题,是真实的工序顺序。
减薄不是一个理由,而是三个方向同时挤出来的一个动作
三、减薄要过五道关
把 775 微米磨到 1 微米,工艺上并不是一道“磨薄”就完事。真正难的地方在于,机械研磨本质上是一次破坏性加工,它一边去材料,一边在硅里留下微裂纹、位错和非晶层。
粗磨是第一道。用大粒径金刚石磨轮快速去掉绝大部分硅,效率很高,代价是留下的损伤层能有几微米深。接下来换小粒径的树脂结合剂磨轮做精磨,把粗磨造成的宏观裂纹修掉,公开资料里的口径是能把亚表面损伤深度压到 2 微米以下,也有资料说精磨之后仍会残留数百纳米量级的亚表面缺陷。无论取哪个口径,结论一样:研磨结束时的表面还不是能用的表面。
所以第三道工序是应力释放。这一步才是决定良率的关口。CMP 用化学腐蚀和机械磨削的协同作用,把受损表层连同残余应力一起去掉,低压下材料去除率大约每秒五十到一百纳米。除此之外还有干式抛光、湿法刻蚀和等离子体干法刻蚀几条路线,各自在损伤层去除深度和表面平坦度之间取舍。省掉这一步会怎样,业界的说法很一致:残余应力会留在片子里,等到后面的热处理或者封装烘烤,它会变成翘曲。
第四道工序针对边缘。晶圆出厂时边缘是圆弧倒角,磨薄之后这个倒角会变成一个又尖又薄的结构,研磨液的冲击、机械振动、搬运时的应力都可能让它崩出微裂纹,而对一片只有几微米厚的晶圆来说,这些微裂纹往往就是后面断裂的起点。常规做法是预先修整边缘,把外圈零点五到一毫米切掉,做成方形边缘。
最后一道是在线测厚。主流研磨设备用测厚传感器实时监控厚度,配合闭环反馈,到了目标厚度自动停。这道工序管的不是“能磨多薄”,是“整片是不是都这么薄”。
从粗磨到在线测厚,五道工序各管一件事
厚度一致性这件事,值得单独算一笔账。一片 300mm 晶圆的中心与边缘厚度差可以到 3 微米。这个绝对差放在 775 微米上占 0.4%,谁都不会在意;等到厚度减到 50 微米,它就占 6%,开始要命;再往下减到几微米,这个数已经不能用百分比描述了,因为它本身就比目标厚度还大。
分母每小一个档,同一个绝对误差的分量就换一个量级。减薄设备真正要比的数字是总厚度变化量。东京精密的 HRG3000RMX 做到 TTV 与 WTW 0.5 微米,华海清科的 Versatile-GP300 做到 TTV 小于 1 微米,这两个数就是这道工序当前的能力边界。
从 3 微米收到 10 纳米,这条链每往下一级就更紧
四、先粘住,才能磨下去
回到那个反常的顺序。
晶圆减到几十微米就会表现出明显的柔性,再往下就极易翘曲、弯曲甚至碎裂。要加工一片这样的东西,先得给它找一个临时的骨架。这套工艺叫临时键合与解键合,流程是一条闭环:先在器件面旋涂临时键合胶并分步烘烤,把胶里的溶剂赶干净;然后与载片贴合,在真空下压平;有了载片撑着,才能进研磨设备做背面减薄;减完接着在背面做金属层、通孔和绝缘层;背面工艺做完,再把载片和超薄晶圆分开;最后清洗掉残胶,转入封装。
在这条流程里,键合要先解决支撑问题。减薄到几百纳米之后,晶圆自己撑不住自己,载片就是替它撑住的那块。把两颗芯片连起来是后面几步才谈的事,那属于永久键合的范畴。
解键合这一步的选择,取决于晶圆被减到了多薄。热滑移走的是最成熟的一条路,加热到胶的软化温度再加平行剪切力,让晶圆滑开,设备便宜、吞吐高,但它通常只适用于 50 微米以上,高温和剪切应力对超薄片并不友好,第三方产业链研究给出的 2025 年份额约 22%。激光解键合把范围推到了 30 微米以下,激光穿过透明载片,烧蚀中间那层大约 1 微米厚的离型层,非接触、室温完成,份额在 36% 到 53% 之间。再往下有光子解键合,用极短的高强度宽谱脉冲光靠热声波效应剥离,能做到 20 微米,目前还在商业导入期。化学解键合用溶剂或超临界流体渗进界面把胶溶开,残胶好清、工艺温和,代价是 300mm 片中心渗透太慢,拖产线节拍。
顺带一个细节能说明这条路走了多久。激光解键合早期用的是 1000 纳米以上的近红外,后来换到 530 纳米,最新一代改成了 248 纳米和 355 纳米的紫外脉冲准分子激光,为的是提高扫描速度、减少烧蚀残渣。
临时键合与解键合是一条闭环,解键合路线按厚度分档
支撑还有另一条思路,而且更省事:干脆不减边缘。DISCO 的 TAIKO 工艺在晶圆外围留下一圈大约 3 毫米的区域不磨,只减中央部分,减完的晶圆像个太鼓,中间薄、边缘厚。结构自带刚性,翘曲可以降低七成以上;研磨不碰边缘,崩角几乎为零;因为没有胶层,它可以直接进高温工序,不必担心脱气和颗粒。代价也很明确,多一道切环工序,成本增加约 15% 到 20%,保留的那圈面积不能做芯片,8 英寸片上会损失 5% 到 8%。
DISCO 官方对 TAIKO 留环结构的说明
这两条路线的取舍点,在于支撑从哪来。临时键合是外加的,用一层胶和一片载片借来刚性,代价是这套胶和界面会一直留到工艺快结束;留环是自带的,用几何换刚性,代价是牺牲一圈面积。前者适用面更宽,后者更干净。
两条路线比的是同一件事:薄片的刚性从哪里来
五、界面上那些近乎苛刻的数
减薄解决的是“剩下多厚”,键合还有另一半题目:剩下的那层东西,怎么跟另一片晶圆严丝合缝地贴在一起。
混合键合靠范德华力实现预贴合,两个表面被抛光到原子级平整之后,靠自身吸引力就能粘住,中间不允许有任何东西。所以它的控制项是一串让人不太适应的数字。介质层表面粗糙度要控制在 0.5 纳米 RMS 以内,铜焊盘更严,1.0 纳米 RMS 以内。铜焊盘还得凹下去一点,凹陷深度落在 3 到 10 纳米之间,浅了会在退火前就提前接触、影响介质粘附,深了退火时铜膨胀填不满间隙,留下电气空洞。界面颗粒要求每平方厘米不到 0.05 个。晶圆翘曲要压在 50 微米以内。贴装精度要到 0.2 微米、3σ 的水平。退火窗口落在 250 到 400 摄氏度之间,低了铜扩散不足,高了会伤到周围结构。
颗粒这一项值得单独记住量级。有键合工艺研究做过观察,一颗 1 微米高的颗粒落在界面上,就能在界面里撑出直径长达 10 毫米的空洞。一微米对十毫米,一万倍的放大。
界面上不能有任何东西,包括一微米的灰
对准是另一条线。以 9 微米间距为例,铜焊盘的直径只有 4 到 5 微米,对位偏差一旦超过焊盘直径的 10% 到 25%,也就是 400 到 1250 纳米,铜与铜就接不上了。量产设备的对位精度目前大概在 100 到 200 纳米,研究线已经在往 40 纳米以下走。
节距本身也在往下压。索尼的图像传感器上已经实现了 0.4 微米节距的铜对铜混合键合。逻辑这边,台积电的 SoIC 对外提供 6 微米节距,最新披露的客户产品出货在 9 微米;英特尔的 Foveros Direct 第一代是 9 微米,第二代规划到 3 微米。研究层面有团队演示了 450 纳米节距,在两千万个互连上做出 98% 的良率。
互连节距与设备订单:键合这条线正在往下压
有一件事被这些数字盖住了:量测的地位。传统封装的检测是抽样,因为缺陷是统计性的。到这一步不行了,单个随机缺陷就能废掉整片,抽样等于赌运气,所以必须对整片晶圆做全覆盖的三维形貌扫描。更棘手的是探针测试本身,物理接触会在焊盘上留下肉眼看不见的形貌变化,痕一旦留下就破坏键合条件,业界只能转向非接触的无损检测。检测从一个辅助环节,变成了决定这条线能跑多快的关键。
六、热的账要重算一遍
第一篇里我写过,背面供电的代价有一半落在散热上。这一节把原因补完整,因为根子就在减薄和键合这两步。
热的通路被改了两处。第一处在被磨掉的那层硅。硅的导热率是 140 W/(m·K),二氧化硅只有 1.4,差一百倍。厚硅层的作用不只是把热往下导,它更重要的是把热点横向摊开,让局部的高温扩散到周围去。减薄之后,这层“摊热板”没了,晶体管夹在正面互连和背面金属之间,热散不出去。
第二处在装配。加工时晶圆是正面朝下键合到载片上的,在最终封装结构里,热主要经过正面互连、键合界面和载片流向散热器。也就是说,键合界面和载片本身进了热必须走的那条主路。imec 的热建模团队负责人 Herman Oprins 把这两件事放在一起说:额外温升主要来自硅衬底的减薄甚至去除导致横向热扩散能力下降,以及硅载片和键合界面进入了通往散热方案的主热路径。
量化证据来自一项仿真。imec 在 2024 年国际电子器件会议上发表的研究,对一颗 80 核服务器 SoC 按真实负载的功耗分布做了 1 微米分辨率的温度仿真,结果是背面供电结构的热点温度最高比正面供电高出约 14 摄氏度。论文把成因归到额外热阻与背面供电自身摊热之间的相互作用。迈尔斯补了一句我认为该记住的话:热点大概率会变得更小、更热。
缓解的思路已经在讨论,方向是设计技术协同优化这一层:把背面供电网络的金属密度做满,靠金属自己做局部横向扩散,这样背面金属反而能起到一部分摊热作用;或者提高正面后道工艺的过孔密度,把通往散热器那一侧的热阻压下去。材料侧也在动,业界正在评估用氮化铝替代二氧化硅做永久熔融键合,看上的是它的导热能力,目前仍在研究阶段。
键合材料这个变量我觉得比它看上去重要。它同时是机械连接和热通路,这两个要求的方向并不总是一致,而这条路径现在被固定在了芯片的主散热通路上。
热环境恶化与背面套刻挑战,是同一套工序带出来的
七、这道工序的供应链比想的更集中
减薄这一段的集中度极高。DISCO 在全球晶圆研磨机市场的份额约 70%,划片机更高,在 70% 到 80% 之间,属于典型的事实垄断。它同时卖设备、卖耗材,磨轮和刀片自己造。截至 2026 年 3 月的财年,公司营收约 4369 亿日元,第一次突破 4000 亿。精度档位上,东京精密的 HRG3000RMX 是目前公开可查的最高一档。
国内在这个环节的进展相对实。华海清科的 Versatile-GP300 减薄抛光一体机已经累计出货超过 20 台,TTV 做到 1 微米以内,公司在国内头部集成电路企业的 CMP 设备采购中占有率最高可达 90% 以上。它的产品线还从减薄扩到了边缘抛光、划切和离子注入。光力科技的机械划片设备从 2025 年 7 月起持续满产,已拿到国内头部封测厂的批量复购。
键合这一段由欧洲设备商主导。按第三方统计,2024 年全球晶圆键合设备市场约 3.2 亿美元,EVG 一家占 59%,SUSS 占 12%,两家合起来接近七成。技术节点上,EVG 与 imec 在 2026 年 5 月演示了 0.2 微米节距的晶圆对晶圆键合。
芯片对晶圆这一支的主角是荷兰的 Besi。这家公司的混合键合系统累计订单超过 150 套,与应用材料一起建了 6 条集成产线,2026 上半年订单 5.626 亿欧元,比去年同期翻了一倍还多。订单涨得快是好事,不过读这类数字要留个心眼:目前下单的主要还是研发线和试产线,能跑量产的没那么多。
国内这一侧,拓荆科技是国内唯一实现晶圆对晶圆、芯片对晶圆混合键合设备量产的企业,国内份额约 90%。但这个 90% 要放在语境里看:2025 年这项业务收入 1.36 亿元,只占公司全年收入的约 2%,公司主要收入仍来自薄膜沉积设备。芯源微的临时键合机和解键合机已进入客户端验证,公司已被北方华创控股。
这道工序的供应链,比想象的更集中
减薄的国产化比键合走得快,差在客户是谁。买减薄设备的是封测厂和存储厂,他们验证国产设备本来就快。键合的客户是那几家先进制程厂商,换设备的周期要长得多,国产设备想进去,得等对方先把工艺路线定下来。
八、一个反例,也是观点
键合这条线上,今年出现了一个反向的信号。
HBM4 要不要上混合键合,行业前两年的答案是一致的:要。算盘很简单,JEDEC 给封装定的厚度上限卡在 720 微米,16 层 DRAM 要挤进这么窄的空间,单层得磨得极薄,而微凸块加底部填充这套结构本身还占着厚度,怎么算都不够。无凸块、铜直接对铜,在当时被当成唯一的出路。
今年这个前提没了。JEDEC 修订标准,把 HBM4 的厚度上限从 720 微米抬到 775 微米。多出的 55 微米摊到 16 层,每层大约三微米。就靠这三微米,厂商能把单层 DRAM 减薄到 30 微米附近,继续用跑了多年的微凸块工艺。三星和 SK 海力士随后把混合键合的导入时间推到 HBM5 世代,那是 20 层堆叠,比原计划晚了大约三年。
抬高的 55 微米是标准腾出来的余量,不等于路线改向。让厂商敢往后退的,是另外两个数。混合键合在 HBM 场景下的良率目前约 10%,它要替换的微凸块方案,量产良率已经在 80% 到 90%。换方案还得重新买设备,一条量产线约 200 亿韩元,折合 1500 万美元。新工艺一般要走到 60% 上下才谈得上商业化,10% 离这条线还远。
微凸块当然也不能一直用下去。堆到 20 层以上,厚度占用、热阻和 TSV 间距会同时吃紧,到那个位置,混合键合的好处才压过成本。这个拐点对应的就是 HBM5。
我把这件事看成一个提醒:技术上非做不可,和商业上什么时候做,是两件事。开关握在良率和成本手里,而这两个变量,又都被减薄与键合这类配套工序的水平卡着。混合键合的性能优势,2016 年索尼在图像传感器上量产时就已经证明过,可它进存储走了十年还没走完。
回到背面供电。这两道工序有个共同点,它们动的是晶圆本身,而不是晶体管或者金属层。这也决定了它们的推进速度跟器件结构怎么设计关系不大,真正卡住的是配套链的整体成熟度。减薄设备的精度、临时键合胶的一致性、解键合的控制力、量测的覆盖率、键合材料的导热能力,这几样里任何一样跟不上,工艺就走不通。第一篇里我说过,真正难复制的不是设备清单上的东西,这一篇给出的具体答案就是这条链。
如果让我从这一篇里挑一个最值得盯的数,我会挑 3 微米,也就是一片 300mm 晶圆的中心与边缘厚度差。这个数在 775 微米上是噪声,在 50 微米上是 6% 的偏差,到了几微米就变成一堵墙。减薄和键合的所有工程努力,很大一部分都是在跟它较劲。
按顺序,下一篇写背面供电之后散热方案会怎么演化,再往后理全环绕栅极与背面供电为什么必须协同设计。
(本文的素材来自 imec 公开技术材料、DISCO 官网技术库、JEDEC JESD270-4 标准和 Semiconductor Engineering、新浪财经等公开报道。有几处口径需要说明。减薄后的剩余厚度在不同技术路线之间差异很大,英特尔的 1 至 3 微米和 imec 研究线上的数百纳米不是一回事,不能直接放在一起比较。14 摄氏度的温升是 imec 针对一颗 80 核服务器 SoC 的仿真结果,不是产品实测值。解键合各路线的份额来自第三方产业链研究的估算。文中涉及的厂商份额、良率和设备参数,也都是企业自行披露或机构估算的口径,没有经过第三方实测。本文不构成投资建议。)





