亲,欢迎光临多多书院!
错缺断章、加书:站内短信
后台有人,会尽快回复!
  • 主题模式:

  • 字体大小:

    -

    18

    +
  • 恢复默认

“英文呢?”

“英文也不差,但没有中文这么好。”徐若辰翻到下一页,是一张英文评测表,“在英文的SuperGLUE基准测试上,我们的模型得分是八十五点三分。Gpt-2的得分是八十二点一分。我们高了三到四个点,但没有中文那种碾压级别的优势。”

李东阳点了点头,又追问:“训练成本呢?”

陈铭宇接过了话:“十二月的版本,训练成本大约是一千两百万美元。大年三十的迭代版本,因为注意力机制的效率大幅提升,训练成本降到了不到六百万美元。后续如果再训练,成本还会进一步降低。”

“推理成本呢?”

“推理成本的降幅更明显。”徐若辰说,“因为推理的时候,自注意力机制的计算量占了绝对大头。我们把o(n2)降到o(n log n)之后,推理速度提升了将近二十倍。同样的硬件配置,以前处理一条一万字文本需要十秒钟,现在只需要零点五秒。”

“零点五秒。”李东阳重复了一遍。

“对。而且成本也相应降下来了。以前处理一条长文本的成本大概是两分钱人民币,现在不到一分钱。如果量大的话,这个差距非常可观。”

李东阳沉默了。

会议室里所有人都在看他。

“下一步的计划是什么?”他问。

徐若辰翻到最后一页,上面列了一个时间线。

“我们计划在三月底之前完成dpY-1.0的正式版本。参数量会从七十二亿扩充到一百二十亿到一百五十亿之间。训练数据总量扩充到两万亿token以上。预计c-Eval得分可以进一步提升到九十五分以上。”

“应用层呢?”李东阳看向陈铭宇。

陈铭宇接过话:“我们已经在规划了。目前考虑三个方向。第一,智能客服。这个是最直接的,海鑫二手回收和京东转转那边的客服需求量很大,如果能用大语言模型替代一部分人工,降本增效的效果会很显着。第二,内容生成。旧石头那边需要大量的剧本、文案、营销内容,大语言模型可以辅助生成初稿,人工再润色。第三,代码辅助。我们内部的技术团队已经在用dpY-0.5的预览版辅助写代码了,效率提升大概在百分之三十左右。”

李东阳听完,站起来,走到白板前。

他看着那个稀疏连接的示意图,看了好一会儿。

“徐博士。”他转过头。

“李总。”

“你现在有多大的把握,这条路是对的?”

徐若辰想了想,说:“技术路线已经验证了。从理论到实验,我们都反复推演过了。剩下的问题是工程化——把模型做大,把推理做快,把成本做低。这些问题,我认为都可以解决。”

“时间呢?”

“一到两年之内,做到可以大规模商用。”

李东阳点了点头,转身看着会议室里的人。

这五十八个人,来自世界各地,放弃了谷歌、微软、脸书的高薪,跑到凌波这个他们之前可能都没听说过的地方,在一个还在建设中的研究院里,没日没夜地写代码、调模型、跑数据。

好在这里老外多,没啥过年的执念。

“我说几句。”李东阳开口了。

所有人都坐直了。

“你们做的事,很重要。不是因为能赚多少钱,而是因为在你们之前,没有人做到过。”他顿了顿,“这个领域,美国起步比我们早。谷歌、openAI、微软,他们有钱,有人,有技术积累。我们追得很辛苦。”

他在会议室里走了两步,停下来。

“但今天你们告诉我,我们在中文语义理解上,已经超过了他们。在这个细分赛道上,我们是领先的。这个领先不是天上掉下来的,是你们一行一行代码写出来的,是一个参数一个参数调出来的。”

他看了看徐若辰,看了看陈铭宇,看了看在场的每一个人。

“我不太会说场面话。我只说一句——辛苦了。”

会议室里安静了一下。

然后不知道是谁带头鼓了掌,所有人都跟着拍了起来。不是那种客套的、敷衍的掌声,是真的在拍。

徐若辰坐在那儿,眼眶有点红,但他忍住了。

陈铭宇站起来,笑着说了一句:“李总难得说这么多话,大家记下来,以后可以当史料。”

几个人笑出了声。

散会后,陈铭宇陪着李东阳在研究院里转了一圈。

大语言模型项目的实验室占了四楼东侧的一大片区域。服务器机房在走廊尽头,透过玻璃能看到一排排黑色的机柜,指示灯一闪一闪的,散热风扇发出嗡嗡的低鸣。

“这是咱们自己搭建的训练集群。”陈铭宇指了指那些机柜,“目前总算力大概是八千万亿次浮点运算每秒。在国内不算最大的,但利用率很高,基本都在跑我们的模型。”

“够不够用?”

“目前够用。但如果把参数量扩大到一百五十亿,可能就要扩容了。”陈铭宇估算了一下,“大概需要再增加百分之三十到百分之五十的算力。”

“你做个预算,我来批。”李东阳说。

两个人走到走廊另一头,透过玻璃能看到一个开放的办公区。

二十几个工位,大部分都坐着人。墙上的白板上写满了密密麻麻的公式和架构图,有些地方画了箭头和圈,看得出来是被反复修改过的。

“这些人,大部分都是徐若辰从美国带回来的。”陈铭宇说,“有的是他在哈佛的同学,有的是他在谷歌的同事。还有一个是放弃了斯坦福的教职过来的,三十出头,学术界前途一片光明,但他说想来做点实际的东西。”

“他叫什么?”

“方远。大语言模型团队的核心架构师,那个o(n log n)的注意力机制,他贡献最大。”

李东阳记住了这个名字。

从研究院出来的时候,天已经快黑了。

李东阳站在楼门口,点了根烟。凌波二月的风比江水柔和一点,但还是很冷,吹在脸上凉飕飕的。

陈铭宇跟着出来,站在他旁边。

“李总,晚上怎么安排?要不就在研究院食堂吃点?今天厨房做的红烧肉不错。”

“行。”李东阳吐了口烟,“吃完我去市里找个酒店住一晚,明天再走。”

“今晚就住这儿呗,研究院有专家公寓,条件还行。您要是觉得行,我让人安排。”

李东阳想了想:“也行,省得跑了。”

两个人往食堂走。

研究院的食堂在一楼,宽敞明亮,能坐两三百人。晚餐时间,来吃饭的人不多,大概六七十个。有些人穿得很随意,头发乱糟糟的,眼底下挂着轻微的黑眼圈,一看就是熬了好几个大夜的。

陈铭宇找了个靠窗的位子,两个人端着餐盘坐下来。

红烧肉,炒青菜,一碗紫菜蛋花汤,一碗米饭。

李东阳夹了一块红烧肉放进嘴里,确实不错,肥而不腻,炖得很烂。

“老陈,”李东阳放下筷子,“你回头帮我整理一份大语言模型项目的详细报告,包括技术路线、团队结构、预算、时间表。我要拿去跟集团其他板块的负责人同步一下。”

“好的。”

“另外,徐若辰、方远这些人,你盯着点。他们不是普通的员工,不能用普通员工的方式对待。待遇给足,股权激励的方案你也抓紧弄出来。”

“已经在做了。”陈铭宇点头,“徐若辰他们的期权方案,春节前我就报给集团了,可能还在流程中。”

“我回去催一下。”

吃完饭,李东阳去了专家公寓。

公寓在主楼后面的副楼里,三层的独栋小楼,每层有七八个房间。房间不大,但收拾得干净,床、书桌、衣柜、独立卫浴,该有的都有。

躺到床上,李东阳跟简晓航视频电话了一会,洗漱完毕,李东阳又在想一件事。

GpU怎么办?

这个也是吃饭的时候老陈跟李东阳提过的问题,老陈担心的资金,采购,机房布置问题。

但是李东阳想的不一样,未来,一旦dpY超越西方,GpU一定会被卡脖子,到时候深空怎么办?

英伟达的GpU,全球独此一家。Amd有替代品,但生态差太多。国内有几家在做,但差距不是一星半点。