一张24G的显卡,运行一个开源的Qwen3.8-27b,就要消耗接近20G的显存,基本上没有太多空间运行其他模型了。

一旦启动这个模型,就没有其他的资源给其他模型运行,那么这张显卡的算力就被占用了。

假如这张显卡能同时支撑一个人日常工作使用,如果此时有1000个用户,一批是欧美用户,一批是亚洲用户。

他们的工作时间是高度确定的,例如亚洲用户早上11点左右和下午4点左右是高峰期,由于时差原因,晚上还会有一个重叠高峰期。

那么问题来了,晚上重叠高峰期和彼此的各自高峰期算力需求达到最高峰,但是...

商家(OpenAI、Claude等模型厂商)不可能按照最高峰值的使用量去准备这个算力,其他时间就会是闲置的(这会导致资本支出回报周期更长)。另外还要分给训练模型,大客户等。

即便租用是云服务商的卡,也是同理,不可能按峰值算力去租用。

这也是现在的OpenAI等模型厂商高峰期卡顿、算力频繁不足的原因。

假如算力一直不是很充足,高峰期出现抢算力,低峰期算力更便宜的情况,或许大家都需要“错峰上班”。