繁体版 简体版
笔趣阁 > 言情小说 > 首富从AI浪潮开始 > 第一百四十三章 把他的数据供应商,挖过来

第一百四十三章 把他的数据供应商,挖过来(第1页/共2页)

本站最新网址:www.biquge666.net

郑晓波这句话一出口,刘大海就知道自己不用再说了。

郑晓波是真的懂。

执掌鼎盛这样一个巨头,确实得有两把刷子,知识储备到了,至少沟通成本能低不少。

而且AI赛道正在风口上,哪家大厂也不敢掉队,对行业的关注甚至不比领域内的投资人和从业者少。

Scale AI,硅谷最炙手可热的独角兽之一,他们不做模型,不做产品,只专注做一件事——数据标注,可以说是AI时代的卖铲人。

就凭这一项业务,Scale AI的估值做到了几百亿美金。

这是什么概念?小半个鼎盛了。

于是刘大海在文档里连翻了几页,跳过了准备好的铺垫,直接翻到一张对比图。

“2023年6月,微软研究院发了一篇论文,叫《Textbooks Are All You Need (你只需要教科书),用精心筛选的教科书级别的数据训了一个十三亿参数的小模型,Phi-1,在代码生成任务上打赢了市面上那些参数量是它十倍、

训练数据是它一百倍的大模型。”

程远插了一句:“刘博士,这是什么概念?”

“当时除了GPT没有一个模型跑得过它。”刘大海说,“只有十三亿的参数,8张A100训练了4天,就这么点成本。这篇论文证明了一件事,数据质量够高,小模型就能干翻大模型。”

他转向郑晓波。

“这和汤圆的情况完全吻合。7B,就是七十亿的参数,一万条训练数据,意图理解打赢了坤元。关键不是模型有多大,是数据质量得好。”

最近几年,这几乎已经成为AI行业的共识了:谁的标注质量高,谁的模型就强。架构变化不大,算力的边际效益递减,但高质量的数据标注才还有很长的进步空间。

问题是,所有人都知道数据标注重要,却没人知道数据标注得好到什么程度才足够。

OpenAI、Anthropic、Meta,每年砸几十亿美金在数据标注上,模型的表现确实是一代比一代强,但进步也越来越慢,谁也不知道什么时候会撞墙,也没人知道极限在哪。

不管资本炒的多么火热,这个行业的所有从业者,大家都在一望无际的大海上摸索前行。

直到看到汤圆,刘大海确信自己看到了未来的信标。

郑晓波没说话。

刘大海的语速慢下来了,声音压低了半度。

“从模型表现倒推,他们的标注精度恐怕是我从业这些年能想象到的最高水平。不是高一点,是高整整一个量级。”

办公室又安静了。

郑晓波的手指在扶手上轻轻敲了两下。

“那他的数据,会是从哪来的?”

这个问题一出来,刘大海和程远同时看向他。

郑晓波的表情没有变化。

刘大海先开口了:

“郑总,我先给您算一笔账,楼一楼。现在行业里最顶级的标注服务,Scale AI的专家级标注,一条大概七八十美金。但那种精度和汤圆的数据比起来,肯定还差了一截。如果按汤圆这个精度去买,市场上根本没有这个服务,

硬要估价的话,一条怎么也得一百美金往上。他们说的是不到一万条数据,就算一万条,光数据成本就是一百万美金。”

“这种精度的标注不可能是一两个人手工做的。要么有专业的标注团队,要么有独家数据源,要么是和哪个大型研究机构合作。”

郑晓波看向程远,下了命令:

“让商务情报团队去查,源码科技的工商变更、公开的合作披露,看看他们最近半年有没有和标注公司或数据机构打过交道。再查查他们的招聘岗位,有没有招过标注相关的人。”

程远点头,在文件夹内页空白处快速记了几笔。

“找到他的数据供应商,”郑晓波说,“直接挖过来。

刘大海补了一句:“如果能找到标注规范文档,那比数据本身还值钱。有了规范至少知道方向在哪,咱们可以试试自己做。”

郑晓波看了他一眼,微微点了点头。

“第二件事,”他的视线回到程远身上,“算力合作可以先谈着。”

程远抬头,好像自己没想通:“谈合作。”

“但是有条件。合作框架里必须包含一条——共享训练数据。”

“如果韩路一不同意呢?”程远问。

“先谈着,但别把姿态摆太高。”郑晓波的声音中气很足,“算力他能找别人要,这个数据我们暂时还找不到第二家。”

“等找到他的供应商,就不用谈了。”

本站最新网址:www.biquge666.net

广告位置下

『加入书签,方便阅读』(第1页/共2页)