欢迎光临
我们一直在努力

AI算力、Token、GPU——翠花想免费用AI,结果被现实打了脸


翠花上周来找我,一脸郁闷。

他说最近用AI干活越来越憋屈——原来随便聊,现在每天几条免费额度,用完就得等明天,或者掏钱开会员。

"有没有办法绕过这个?"他问我。

我说有啊,本地部署。

他眼睛亮了。

“就是把自己电脑变成AI服务器,模型装在自己机器上,想怎么用怎么用,不用联网,不用担心额度,也不用担心数据隐私。”

翠花当场决定:搞。
在这里插入图片描述

然后我给他泼了冷水。


先搞懂一个问题:你的电脑跑得动吗

翠花说他的电脑是三年前买的,当时配的时候还算主流。

我问他知不知道CPU和GPU的区别。

他摇头。

其实大多数人都不清楚,但这件事决定了你能不能跑AI。


CPU是高材生,GPU是一群小学生

CPU就像一个高材生,逻辑强但只有一个脑子。GPU呢,就像一千个小学生,单个啥也不会,但架不住人多,同时做题一秒钟全部算完。

AI干的就是这种海量、简单的并行运算——高材生(CPU)太慢,一群小学生(GPU)才是正确打开方式。
在这里插入图片描述


算力到底是什么

说清楚了CPU和GPU,算力就好理解了。

算力就是单位时间内能处理多少运算。

手机里的CPU,一秒钟能算几亿次。听着多,但对AI来说不够。

电脑上RTX 4090显卡,算力大概是83 TFLOPS——每秒83万亿次浮点运算。

什么概念?

用CPU跑一个7B参数的开源模型,生成一个词可能要零点几秒,聊一段话等半天。

用4090,生成速度快10倍以上,基本感觉不到延迟。

这就是为什么AI一定要用GPU。CPU不是不能跑,是跑得太慢了,慢到没法用。


Token跟算力的关系

Token是什么,之前专门写过一篇,不再重复(没看过的可以翻一下《什么是Token?翠花说AI肯定认识汉字,我当场证明她错了》)。

这里只说一句话:每个Token的生成,都要把整个神经网络的参数跑一遍,这是纯算力消耗。

Token越多,烧的算力越多。


算力和Token的关系

说到这里,关系其实就清楚了。

算力大小,决定了两件事:生成每个Token的速度,以及能同时处理多少个Token。

按Token收费的逻辑也在这里——不是厂商想割韭菜,是每个Token真的要烧算力、烧电、烧显卡。

在这里插入图片描述


回到翠花的问题:你的电脑能部署什么级别的模型

翠花听完,沉默了一会儿。

“那我这电脑,能跑什么?”

我说实话——普通个人电脑能跑的模型,级别就这么几个,而且门槛不低。

在这里插入图片描述

翠花的电脑,显卡是集成显卡,连独立显卡都没有。

我告诉他:用CPU跑7B模型,不是不行,就是你会觉得自己在跟树懒聊天。


距离正常使用还有多远

这才是真正的问题。

现在的开源模型,7B这个级别,性能大概相当于GPT-3.5的水平——能用,但没那么聪明。

想要更好的效果,就得上更大的模型,13B、34B、70B……但模型越大,需要的算力越高,显存需求也越高。

普通人想在自己电脑上跑一个"好用"的大模型,现在的门槛还是挺高的。

不是完全不可能,是需要花钱升级硬件。

一张能跑大模型的显卡,便宜的几千,贵的上万。

这就是为什么大部分人还是选择用云服务——不是不想本地部署,是成本太高了。


下期预告

翠花最后问了我一个问题:“那这些模型的7B、13B、70B,到底是什么意思?为什么数字越大越厉害?”

这个问题问到了点子上。

这些数字,就是大模型的参数数量。

参数到底是什么,为什么越多越好,多少个参数才算"够用"——下期讲。


关注小虾,一起成长,一起进化

赞(0)
未经允许不得转载:171主机测评 » AI算力、Token、GPU——翠花想免费用AI,结果被现实打了脸
分享到: 更多 (0)

评论 抢沙发

  • 昵称 (必填)
  • 邮箱 (必填)
  • 网址