B站AI科普视频的数据可靠吗?有点不敢全信

最近刷B站看了好几个AI科普视频,讲大模型训练、数据量啥的。里面引用了一些数据,比如说GPT-3有1750亿参数、训练数据45TB什么的。但我自己在网上查到的数字好像不一样,有的说GPT-3实际参数是1750亿,但训练数据说法很多。 我本身就是做数据分析的,对这些数字比较敏感。感觉有些UP主为了讲得通俗,可能把数据简化了,甚至有点夸张。比如有个视频说“某模型训练用了全网数据”,这说法也太模糊了吧。 想问下懂行的朋友,这些科普视频里的数据到底靠不靠谱?有没有什么渠道能自己核实?...

Viewed 3

最近刷B站看了好几个AI科普视频,讲大模型训练、数据量啥的。里面引用了一些数据,比如说GPT-3有1750亿参数、训练数据45TB什么的。但我自己在网上查到的数字好像不一样,有的说GPT-3实际参数是1750亿,但训练数据说法很多。

我本身就是做数据分析的,对这些数字比较敏感。感觉有些UP主为了讲得通俗,可能把数据简化了,甚至有点夸张。比如有个视频说“某模型训练用了全网数据”,这说法也太模糊了吧。

想问下懂行的朋友,这些科普视频里的数据到底靠不靠谱?有没有什么渠道能自己核实?还是说他们只是为了流量瞎编的?我怕信了错误的数据,以后跟别人讨论时闹笑话。求大佬解答。

4 Answers

B站 AI 科普视频的数据不能全信,但多数也不是瞎编。方向性结论、模型之间的比较通常有出处,具体参数和“训练数据量”这类数字最容易失真。GPT-3 有 1750 亿参数这个说法基本准确,训练数据 45TB 则是流传较广的一种换算口径,回原论文会发现原文讲的是经过过滤的数据集和 token 数,二手文章换算方式不同,数字自然对不上。做数据分析的人,关键是把“结论”和“具体参数口径”分开核。

B站科普视频为什么数字容易对不上

科普视频为了讲得通俗,经常会把论文里的多个口径压成一个数字。比如训练数据量可能有 token 数、经过过滤后的文本量、原始爬取量好几种说法,视频只挑一个最容易理解的,再被评论区和其他文章转一道,偏差就出来了。也有 UP 主会把某个模型的旧版本数据当成最新版说,或者把“公开数据集”直接说成“全网数据”。

自己核实 AI 模型数据的 3 个步骤

  1. 回原始论文。GPT-3 的原始论文标题是 Language Models are Few-Shot Learners,1750 亿参数就写在摘要里,这是最该信的一手来源。
  2. 查官方技术报告或模型卡。OpenAI、Google、Meta 发布模型时通常会在官网挂技术报告,参数量、训练 token 数、数据来源都以报告为准。
  3. 用权威媒体交叉检索。拿不准的数字,在 新华网人民网 站内搜模型名+参数,看是否与论文口径一致。国内模型的备案信息、公告可以查 国家网信办 的生成式 AI 备案名单。

听到这些话要打折听

视频常见说法 更接近事实的表述
“训练用了全网数据” 只用了经过过滤、去重、配比后的公开数据集
“训练数据 45TB” 是某个口径下的文本量估计,token 数往往更稳定
“参数越多越聪明” 只是规模指标,不等于实际表现更强

几个特别容易踩的坑

  • 把“参数量”和“训练数据量”混在一起说,两个是完全不同的指标。
  • 拿早期版本的模型数据当成当前最新版讲,尤其是 GPT 系列,版本多、口径变化快。
  • 把二手博客或知乎回答里的数字当成原始出处,再被视频引用一遍,偏差会越传越大。
  • 看到“全网”“人类所有知识”这类词,基本可以判定是口语化夸张,不用较真。

综合下来,B站科普视频适合帮你快速理解大方向,不适合作为精确数据的引用来源。跟别人讨论时,凡是具体到参数、数据量、训练成本这类数字,回到论文和官方报告核一眼再开口,基本就不会闹笑话。

楼上说得挺全,我也补充点我自己的理解。其实B站这种科普视频很多确实是为讲得通俗,数据经常被简化或者泛泛而谈。还有就是“全网数据”这种说法也真的是模糊到家,没人能做到全网全抓,数据来源和清洗程度差别太大。你自己做数据分析,肯定看得出来这些数字背后很多细节和限定条件都没交代,完全拿出来听听娱乐下就好。要想核实,最好还是去看看论文原文或者官方发布的技术文档,毕竟科普UP主多是二手搬运或者自己理解带偏了,不算恶意,但确实不能全信。反正我看这类视频基本都保持点怀疑态度,不然很容易被吹得天花乱坠。

我也有这感觉,做数据的人看这些科普真的容易血压高。参数、数据量这些数字网上随便一搜就有不同版本,up主可能自己也没去查原始论文,就搬运二手资料了。想核实的话直接去翻原模型的技术报告(arxiv上都有),虽然英文看着累,但数字最准。别怕闹笑话,能怀疑这些视频的人已经比大多数人强了。

我也在B站看过几个类似视频,感觉那些数据经常被简化成“1750亿”“45TB”这种好记的数字,实际来源和处理方式很少细说。你是做数据分析的,信源还是多看看arxiv或者模型的官方技术报告比较稳。视频嘛,就当个大概了解,别全信着跟人聊。