跳到主要内容

算力届的统一度量衡:TOPS、TFLOPS 与芯片算力标准的混战与救赎

引言

2026年,全球AI算力军备竞赛愈演愈烈。NVIDIA 的 Blackwell Ultra GPU 号称 FP8 算力达到 XX PFLOPS,华为昇腾 910C 标注峰值算力达 XX TFLOPS,苹果 M4 Ultra 的 NPU 宣称 XX TOPS,高通的骁龙 Gen 5 也在移动端算力上屡创新高。

但一个尴尬的现实是——这些数字根本无法直接对比。一家厂商用 FP16 峰值算力,另一家用 INT8 推理 TOPS;有人报稀疏算力,有人报稠密算力;有的标注理论峰值,有的标实测性能。"30 TFLOPS"和"30 TOPS"相差近一个数量级,但这些数字却被放在同一张对比表上。

本文试图回答一个核心问题:AI算力有没有统一的"度量衡"?如果没有,我们该如何正确理解这些数字?

一、算力单位的基本认知

1.1 算力的本质

算力的本质很简单:芯片在单位时间内能完成多少次计算操作。就像速度是"米/秒",算力是"计算次数/秒"。但"一次计算"的定义因数据类型和计算场景的不同而千差万别。

1.2 两大主流单位:TOPS 与 TFLOPS

单位全称含义适用场景
TOPSTera Operations Per Second每秒万亿次整数运算AI推理(INT8量化)
TFLOPSTera Floating-point Operations Per Second每秒万亿次浮点运算AI训练、科学计算

一个常被忽略的核心区别:TOPS 和 TFLOPS 不是同一物理量。整数运算(OPS)和浮点运算(FLOPS)的计算复杂度、硬件消耗完全不同,不能直接换算或对比。

1.3 同芯片不同精度的算力差距

同一块芯片在不同数据类型下的理论算力差异巨大:

  • INT8 算力 ≈ 2 × FP16 算力 ≈ 4 × FP32 算力
  • 原因很简单:数据类型占用的位数越少,芯片一次能并行处理的数据就越多

以 NVIDIA H100 GPU 为例:

  • FP32(32位):约 67 TFLOPS
  • FP16(16位):约 134 TFLOPS(使用 Tensor Core)
  • INT8(8位):约 268 TOPS

如果只看括号里的数字,268 > 134 > 67,但这完全是因为单位不同。更有厂商用稀疏(Sparse)算力标注,即在矩阵中利用 50% 的零元素跳过计算,使标称"算力翻倍"——这进一步加剧了数字的混乱。

二、算力度量的三重混乱

2.1 第一重混乱:精度混用

一个常见的陷阱是:有人用 INT8 算力比对手的 FP16,有人用稀疏算力比对手的稠密算力

例如:

  • 厂商 A 宣传"芯片算力达 200 TOPS"(INT8 推理)
  • 厂商 B 宣传"芯片算力达 100 TFLOPS"(FP16 训练)
  • 两者都是"100 级别"的数字,但 200 TOPS ≈ 100 TFLOPS(FP16)?完全不能这么算!

TOPS 和 TFLOPS 是不同维度的量,就像用"公里/小时"对比"海里/小时"——虽然都是速度单位,但基准不同。

2.2 第二重混乱:理论峰值 vs 实际性能

理论峰值算力(Peak FLOPS/TOPS)是厂商最容易注水的地方。理论上芯片可以做到的极限值,在实际应用中几乎不可能达到。

  • 理论峰值:芯片所有计算单元满负荷运行,不考虑数据搬运、内存带宽、散热限制
  • 实际性能:受内存带宽、张量形状、模型特性、软件栈优化等影响,通常只有理论值的 30%-70%

NVIDIA H100 在 Transformer 模型上的实际训练吞吐量,可能只有理论 FP8 TFLOPS 的 40-50%。而华为昇腾 910B 在某些模型上的实际性能表现,与理论标称值之间的差距更大。

2.3 第三重混乱:跨架构对比的难题

不同芯片厂商的架构差异,使得即使采用相同的精度单位和测试条件,直接对标也不合理:

  • NVIDIA GPU:Tensor Core 专为矩阵乘法设计,在 LLM 上有巨大优势
  • AMD MI300X:CDNA 架构在大规模并行计算上有一定特点
  • 华为昇腾:Da Vinci 架构在特定算子上有优化
  • 苹果 M 系列:统一内存架构在端侧推理有独特优势
  • 高通/联发科:侧重移动端功耗比,轻量级推理效率高

一个典型案例:苹果 M4 Ultra 的 NPU 标注 80 TOPS(INT8),而 RTX 4090 标注 1321 TOPS(INT4 稀疏)。两者数值相差 16 倍,但用的精度和稀疏策略完全不同,放在一起对比毫无意义。

三、标准化运动的努力与困境

3.1 MLPerf:行业最受认可的基准测试

MLCommons 推出的 MLPerf 系列基准测试是目前行业内最权威的算力标准对比平台。它覆盖训练(Training)和推理(Inference)两大场景,通过统一的模型、数据集和规则,让不同硬件在相同条件下进行公平对比。

MLPerf 的核心理念是"关掉注水龙头":它关注的不是理论峰值 FLOPs,而是完成特定任务所需的时间——比如用多少分钟训练完 BERT-Large,或每秒能处理多少张图片的推理请求。

3.2 最新进展:MLPerf Client 与 AI PC 标准

2025-2026 年,MLCommons 推出了 MLPerf Client 基准测试,专门用于评估 LLM 在 PC 和移动设备上的推理性能。这一标准首次覆盖了大语言模型(LLM)在边缘侧的真实表现,包括文本生成速度、首 Token 延迟(TTFT)、Token 生成速率等指标。

3.3 标准化困境

尽管 MLPerf 取得了显著成功,但完全统一算力度量仍面临巨大挑战:

  1. 场景多样性:训练、推理、边缘部署、移动端的需求截然不同,一套通用的"算力分"无法涵盖所有场景
  2. 厂商利益冲突:各厂商倾向于选择最能突出自身优势的度量方式
  3. 技术快速迭代:新架构(如 AMD 的 CDNA 4、Intel 的 Gaudi 3、Google 的 TPU v6)不断涌现,基准测试需要持续更新
  4. 端侧生态割裂:Android、iOS、HarmonyOS 等不同生态的 AI 性能难以跨平台统一衡量

3.4 中国的算力标准建设

2024-2026 年,中国也在加速算力标准化进程。中国信通院发布了一系列"AI芯片算力评估规范",涵盖通用计算、AI训练、AI推理三大场景的测试方法。同时,"东数西算"工程也推动建立了算力调度和度量相关的国家标准。

四、如何正确理解和对比算力?

4.1 算力对比检查清单

面对两张芯片的参数表,你至少需要问以下问题:

  1. 这是什么精度? FP32/FP16/BF16/INT8/INT4?
  2. 是 TOPS 还是 TFLOPS? 整数还是浮点?
  3. 是理论峰值还是实测性能? 参考 MLPerf 或实际 benchmark 数据
  4. 是稠密算力还是稀疏算力? 稀疏声称的翻倍效果在实际场景中很难达到
  5. 什么工作负载? 训练 LLM 还是跑视觉推理?不同任务对芯片的需求差异巨大

4.2 三层次评估框架

层级指标目的举例
理论层峰值 TFLOPS/TOPS快速筛选上限H100 FP8: 约 1979 TFLOPS
基准层MLPerf 分数横向公平对比H100 BERT 训练: ~X 分钟
应用层实际场景性能选型决策运行 LLaMA-70B 的 Token/s

核心原则:理论层看上限,基准层做横评,应用层做决策。

五、未来展望:走向真正的"统一度量衡"

5.1 行业趋势

  • MLPerf 将持续主导:随着 MLPerf Client 和 MLPerf Endpoints 的推出,覆盖场景会更加全面
  • 能效比成为新维度:单纯比峰值算力越来越没有意义,Performance per Watt(每瓦性能)正在成为更受关注的指标
  • 端侧标准化加速:MLPerf Client 和行业联盟(如 Linaro ML 工作组)正在推动移动和 PC 端 AI 测试的标准化
  • 中国标准与国际接轨:信通院标准与 MLPerf 的互认正在推进

5.2 给从业者的建议

  1. 不要迷信峰值算力——芯片不是跑 Roofline 模型用的硬件,真实场景千差万别
  2. 始终关注精度上下文——所有算力数字都必须附带精度标签(FP16/BF16/INT8)
  3. 优先参考 MLPerf——这要比厂商自报的数据可信得多
  4. 关注TOPS/W 而非仅TOPS——在端侧部署中,能效比才是真正的硬约束

结语

算力届至今缺乏像"米"和"千克"那样公认的统一度量衡。TOPS、TFLOPS、FP32、INT8、稠密、稀疏——这些概念构成了一个让从业者眼花缭乱的"计量丛林"。

但正如物理学的统一需要标准度量衡,AI 产业的成熟也必然要求算力标准的统一。MLPerf 是当前最接近"行业裁判"的存在,但完全的统一可能永远不会到来——因为技术的多样性本身就是进步的动力。

对于每个 AI 从业者而言,理解这些数字背后的含义,远比记住这些数字本身更重要


参考来源:CSDN《一篇看懂:算力、TOPS、TFLOPS、FP32/FP16/INT8 全解析》、MLCommons MLPerf 官方文档、NVIDIA/AMD/华为硬件技术白皮书、中国信通院AI芯片评估规范、知乎《读图易,分析难:大模型的计量单位 petaFLOP》