查看: 60110|回复: 596
打印 上一主题 下一主题

翼华科技贾淑芸: 在网络算力这一层,让每个Token更便宜_我的网站

[复制链接]
跳转到指定楼层
楼主

如果我爱你

翼华科技贾淑芸: 在网络算力这一层,让每个Token更便宜_我的网站

天下足球

一 |     7月18日下午,由观察者网、WAIC CONNECT主办,半导体行业观察协办的“「重构算力」——AI算力需求与供给的结构性重构产业链接会”在上海张江科学会堂举办。

二 | 作为WAIC 2026同期的一场重要产业活动,这场汇聚了政府、产业方与需求方的闭门研讨,把目光聚焦到AI算力供需两端的深层结构性变化。

三 | 在CES 2019年主旨演讲中,黄仁勋大部分时间都离开了赛场。因此,2019年的因维达CES展自然会包括新产品和新技术。在特别的游戏演示室里,我们看到了Geforce RTX 2060笔记本,一款全新的G-Sync显示产品,以及一款65英寸的Omen Eperium 65 bfgd显示屏,即将出售。G-SYNC重新进化G-SYNC和Geforce图形卡无疑是完美的匹配。

四 |          在主旨演讲嘉宾中,翼华科技(北京)股份有限公司联合创始人兼高级副总裁贾淑芸的分享格外引人关注。

五 | 相较于场上被反复讨论的GPU、大模型与推理芯片,她所代表的DPU(数据处理单元)与智能网卡,是产业链条中一个更为“隐性”却越发关键的环节。在新闻发布会上,英伟达将G-Sync细分为三个级别,最低级别为无G-Sync,其次为G-Sync兼容,最高级别为G-Sync终极。         算力集群不是“堆卡”,是“组网”          “现代AIDC其实已经是一个巨型机系统。

六 | ”贾淑芸在接受观察者网专访时着重强调了这一点。G-Sync兼容并不意味着它必须为G-Sync技术而构建,但在Nvidia的实际测试中,它仍然能与G-Sync显示出良好的兼容性,这意味着它可以在不付出太多成本的情况下实现与G-Sync显示类似的性能。她把大型AI数据中心的问题归纳成三件事——“算、存、运”。         算,就是外界最为熟悉的GPU与推理芯片;存,对应显存、内存和闪存;而运,也就是通信,正是DPU与智能网卡所承担的部分。在超过400个可变刷新率监视器的实际测试中,只有12个监视器符合G-SYNC兼容标准,NVIDA慷慨地给出了推荐购买列表供玩家参考。

七 |          大模型训练与推理从来不是一张卡的独角戏,而是成千上万、甚至数十万张卡的集体作业。每完成一步计算,卡与卡之间就需要一次乃至多次数据交换。

八 | 顾名思义,G-Sync Ultimate是下一段时间内G-Sync的最高标准。它将代表所有高端显示技术的集合,例如需要支持HDR 10、高可变刷新率、超低响应时间、配备G-Sync芯片等。英维达还展示了一些尴尬的只支持自由同步显示在游戏过程中,如闪光屏幕,绘画撕裂等。交换尚未完成,下一步就无法开工。

九 | 也就是说,昂贵的算力在集群里有相当一部分时间其实是“在等网络”。似乎在N卡前面的自由同步的强制打开没有太多好的水果吃。

十 |          DPU与智能网卡真正做的事,是把网络协议处理、RDMA通信这些原本占用CPU、GPU的活承接过来,为计算核心提供一个稳定、可预测、可靠的通信接口;再把网络里的排队、丢包、重传抹平,不让任何一次尾部延时把整个集群拖入等待;同时把存储、安全等基础设施卸载下来,让大模型的记忆系统可以快速检索,不“失忆”。当然,英伟达对朋友的支持也不缺,比如35英寸的罗格-斯威夫特PG35VQ将被出售。         一旦缺了这一层,后果对贾淑芸而言是显而易见的:GPU利用率上不去,万卡集群跑出五六千卡的有效算力,几乎等于把一半的采购成本打了水漂;集群规模越大越不稳定,一次长尾延时、一次网络抖动,就可能让整个训练任务中断回滚;CPU还会被网络和存储协议栈吃掉大量核数,整机成本进一步恶化。她给出的结论是,算力集群从来不是“堆卡”,而是“组网”——网络算力这一层,决定了买来的GPU算力最终能兑现多少。它不仅支持G-SYNC 3440 x 1440,而且刷新率为200赫兹。         为什么是RISC-V          国内做DPU的公司不少,但大多数选择了ARM内核方案,翼华科技走的是自研RISC-V内核的路线,其首款基于自研RISC-V核的智能网卡已经流片并商用落地。价格似乎不便宜。这样一个相对独特的技术路径,背后是怎样的考量?          贾淑芸对观察者网阐述,成本、生态、供应链安全,都在权衡范围之内,但最根本的原因是DPU这个品类与RISC-V的技术特性天然契合。她解释,DPU本质上是一颗领域专用处理器,核心任务是报文处理与存储、计算卸载,追求的是高带宽、低时延与能效比,而不是通用计算意义上的大而全。

十一 | RISC-V最大的优势就在于指令集可以灵活扩展——针对网络报文处理、KV管理加速去定制指令与微架构,尤其是矢量扩展(Vector Extension)非常适合数据面与检索类工作,这在标准ARM核授权模式下很难做到。

十二 | 更便宜的是即将推出的bfgd 65英寸显示器omen eperium 65,最大4K 144Hz加上G同步和屏蔽功能。毫无疑问,惠普甚至减轻了显示器的重量,使其在正式量产之前更容易搬运和挂在墙上。同时,这种显示器在国外的价格接近5000美元,足以让我们买一台高端4K电视机。         翼华自研的RISC-V核支持RVA23规范,具备多发射、乱序执行、浮点与矢量计算能力;SoC层面则采用了灵活的集群架构,CPU核与自研的网络、安全加速引擎通过高带宽总线紧耦合,能够按客户对性能、功耗、面积的不同要求灵活配置。对于外界关心的生态短板,她也做了分析——相比x86和ARM,RISC-V生态确实还有差距,但对DPU来说“够用了”:GCC、LLVM工具链、Linux操作系统、DPDK等网络开源软件的支持都已经比较成熟,翼华本身也在通过开源方式反哺RISC-V在网络和存储方向的生态。Geforce RTX 2060笔记本到Geforce RTX 2060图形卡以及Geforce RTX 2080、RTX 2070笔记本也在现场展出。         这条路径对翼华的竞争力意味着什么?意味着性能优化的天花板从此掌握在自己手里;产品定义摆脱了指令集授权的约束,可以跟随客户需求快速迭代;从指令集到核到SoC的全链路自主可控,在当前的产业环境下,对客户而言更是实实在在的价值。在Geforce RTX 2060的测试中,我们发现Geforce RTX 2060的性能与Geforce GTX 1070 Ti相当,但DLSS和RTX使其更具吸引力。现场演示也是如此。通过游戏优化和DLSS合作,Geforce RTX2060可以在保证高质量的前提下轻松实现光线跟踪效果和高帧数,这也使得视频卡本身具有成本效益。

十三 | RTX笔记本可能是游戏笔记本玩家最容易达到高潮的产品。首款RISC-V智能网卡的流片与商用,也验证了这条路线走得通。现场显示笔记本电脑包括Microstar GS65、Lenovo Y740、Razer Blade 15、Alienware M15、Rog Zephrus S GX531、Acer Preditor Triton均使用Geforce RTX 2080 Max-Q图形卡,而HP Omen、Giga Aero 15和Microstar GS75则使用Geforce RTX 2070 Max-Q玩游戏。

十四 | 演示、流利、管理得当就足够了。         从“省”到“快”:图南系列的AI适配          DPU最初是云厂商的故事,主要解决虚拟化卸载、多租户隔离这类问题。关键是Geforce RTX系列图形卡笔记本电脑也更容易获得完整的游戏体验。

十五 | 毕竟,你不需要额外的G-SYNC显示器,笔记本电脑制造商也不会通过成本控制夸大他们的价格。可以肯定的是,2019年的钱包生活注定是艰难的。但当AI大模型训练成为主角,网络吞吐与时延的要求较之传统云计算已经高出好几个量级。

十六 | 这样的需求切换,如何反过来定义DPU的产品设计与商业模式?          贾淑芸的判断是“根本性的”变化。她把云时代DPU的核心命题概括为一个字——“省”,把虚拟化、多租户隔离、存储协议这些开销从CPU上卸下来,帮云厂商省出可以对外销售的CPU核数;而AI时代DPU的核心命题则换成了“快”,训练集群对RDMA吞吐、时延和抖动的要求高出数个量级,网络性能直接决定了GPU利用率,也直接决定了每一次训练任务的成本与成败。         这种变化传导到产品与商业两个层面。产品设计上,重心从控制面卸载转向数据面性能:RDMA引擎要自研,拥塞控制算法要深度优化,大规模组网下的低时延低抖动要有保障,还要和调度系统、集合通信库紧密协同。

十七 | 无论是Geforce RTX笔记本电脑、G-Sync显示器还是台式电脑,都有很多花钱的理由,而且这些产品中的许多很快将在第一季度上市销售。似乎如果没有2019年的Computex,今年的PC升级预算将耗尽。商业模式上,客户也从头部云厂商的定制项目扩展到智算中心、服务器整机厂和行业客户,产品的标准化和兼容性要求随之提高,国产化替代成为一个明确的增量市场。         翼华科技的“图南”系列智能网卡,正是按照这一逻辑打造的。它基于翼华拥有自主知识产权的芯片架构实现高吞吐线速转发,配合自研的RDMA技术面向智算场景大规模组网做优化,同时保留P4可编程能力,让网络、存储、安全、运维等各类负载都可以灵活卸载,既满足AI训练推理对高性能网络的严苛要求,也能覆盖云数据中心与边缘计算的传统场景。RISC-V的通用处理能力则被用来实现流量的管理和调度。         在此基础上,翼华还计划推出“培风图南”系列AI-DPU。

十八 | 借助RISC-V的通用处理能力与RVV向量处理能力,这条产品线将进一步实现KV Cache管理的卸载与加速,构建大模型的"记忆层",降低推理应用的部署成本,同时提升推理速度。         客户到底为什么买单          英伟达BlueField系列早已大规模部署,国内DPU赛道这几年也涌现出不少创业公司。翼华的图南系列既然已经商用,主要落地在哪些客户手中?          贾淑芸介绍,图南系列SuperNIC目前的客户可以分成几类:智算中心的建设方与运营方,用它做GPU集群的高性能参数面与存储面网络;服务器整机厂商,把智能网卡作为整机方案的标准部件;云和边缘计算客户,用于虚拟化卸载和5G边缘业务加速;此外在运营商与部分行业客户侧也有项目在推进。而计划推出的培风图南系列,则将主要面向大模型应用公司和Token工厂运营方,通过构建大模型记忆层降低推理部署成本、同时提升长程任务的推理性能。

十九 |          至于客户在选择国产DPU时最看重什么,她的答案与外界的直觉不太一样:稳定性和兼容性排在第一位,价格反而排在最后。

| 原因并不难理解——网卡是7×24小时在线的部件,客户不会为了追求部分性能特性而牺牲可用性,能否平滑接入现有的服务器、交换机与软件栈,是商用的前提;其次才是性能,尤其是RDMA场景下的真实表现。“客户算的是总账,一张卡如果能把GPU利用率提上来几个点,卡本身的价差可以忽略不计。”贾淑芸表示,翼华的策略一直是把稳定性和兼容性做扎实,再谈性能领先。         行业洗牌中的生存法则          2021年、2022年,DPU一度是资本追捧的风口,大量创业公司涌入。此后两年,赛道明显进入收缩与整合期。作为一家2022年成立的公司,翼华科技如何看待这一轮洗牌?          贾淑芸对那段热潮做了深入剖析。认为其中确实有泡沫的成分——资本看到了BlueField的故事,团队蜂拥而入,但很多公司低估了两件事:一方面,芯片的产业周期是硬约束,从流片到商用再到规模上量,没有三五年下不来,烧钱速度远超预期;另一方面,DPU并不是一颗芯片的生意,而是一整套软硬件生态的生意,驱动、协议栈以及与客户环境的适配工作,工程量甚至比芯片本身还要大。这两年资本退潮、行业整合,本质上是回归常识。         翼华成立于2022年,恰好赶上热潮的尾巴与寒冬的开头。这样的时点,反而倒逼团队从第一天起就保持克制——不追求大而全的产品定义,聚焦智算这个真实需求场景;控制团队规模与研发节奏,把资金花在流片和客户落地上。她提到,2022年也正好是面向GPU互联的SuperNIC元年,翼华科技从起步阶段就锁定了SuperNIC与AI-DPU这两大潜力市场。         而在她给出的DPU公司生存清单里,有几点尤为关键:芯片要真正流片、真正商用,而不是停留在PPT和FPGA原型阶段;要有付费客户、有可复制的场景,形成正向的收入循环;还要在英伟达和头部云厂商自研之外,找到自己不可替代的差异化位置——比如翼华科技选择的RISC-V自研路线,以及为大模型构建记忆层的AI-DPU路径。

| 行业洗牌未必是坏事,泡沫出清之后,留下来的公司会拿到更集中的资源和更清晰的市场。

|          国产智算的网络答卷          产业最关切的宏观议题之一是国产智算能否实现真正的全栈自主。

| 今天的智算中心,机内互联主要依赖NVLink,机间互联依赖InfiniBand,本质上仍是英伟达的封闭生态。         在贾淑芸看来,这是最关键也最难攻克的一层。国产GPU单卡性能还在追赶,但如果互联问题不解决,卡越多、集群效率损失越大,“全栈自主”就只能是一句空话。她给出的方向是开放的以太网路线——用增强以太网加RDMA去对标乃至超越InfiniBand。这也是全球产业的共识方向,超以太网(Ultra Ethernet)等新标准的演进,本质上都是要用开放生态对抗封闭体系。

|          要走通这条路,必须有三个层面的支撑:高性能的国产网卡与DPU芯片,把RDMA、拥塞控制这些核心能力真正做到自主;国产交换机与国产GPU的端网协同,一张好网卡还不够,整个链路要一起调优;开放的标准和软件生态,让智算中心不被任何单一厂商锁定。         翼华科技的产品与生态布局,也是沿着这三条线在推进。产品上,图南系列将加速向更高带宽演进,持续强化面向智算场景的自研协议处理引擎和拥塞控制能力;生态上,翼华正与国产GPU厂商、服务器厂商、交换机厂商推进深度的端网适配和联合方案;同时通过开源P4处理器和自研的虚拟协议处理器,提供快速适配开放协议的能力,反哺网络标准和协议组织——凭借可编程的方法,翼华SuperNIC可以同时支持RoCE、UEC乃至各家的自定义协议。         “我们的目标很明确:在国产智算的网络算力这一层,做出真正可规模商用的自主选择。”贾淑芸这样总结。         回到WAIC「重构算力」的现场议程——训练推理转型、国产算力生态、HBM/CPO先进硬件、万卡集群调度、智算新基建全链路成本测算,几乎每一个议题都指向同一个命题:算力供需之间的结构性重构。而在这场重构里,DPU与智能网卡所代表的“网络算力”环节,正是决定国产AI基础设施上限的关键变量之一。翼华科技所代表的自研RISC-V DPU路线,能否在这一轮洗牌之后跑出属于中国的BlueField,将是产业界接下来数年最值得关注的看点之一。         本文系观察者网独家稿件,未经授权,不得转载。

Current article:http://374eze6.caonaishengpengchuali.shop/aylk4/20260826/641399.xls

Published on:06:03:11


点击获取礼包
沙发
发表于 07:41:23 | 只看该作者
郑州大学女神教官 穆赫兰道 bilibili
板凳
发表于 12:12:44 | 只看该作者
黑金 凤凰大视野 少年派的奇幻漂流
地板
发表于 19:37:33 | 只看该作者
第八号当铺 文化大观园 北京房价均降1万
5#
发表于 19:20:23 | 只看该作者
初恋这件小事 诱惑我小妈 丁克
6#
发表于 08:21:51 | 只看该作者
戏说乾隆 血战太平洋 饭局的诱惑
7#
发表于 20:32:24 | 只看该作者
罗生门 生活大爆炸第六季 西西里的美丽传说
8#
发表于 16:19:07 | 只看该作者
铁石心肠 头文字d 神雕侠侣
9#
发表于 05:23:40 | 只看该作者
龙的天空 正能量 80s
您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

我的网站是互联网最大的搜索引擎优化研究中心,是致力于培养学员用户体验意识和提供专业技术解答的专业培训机构, 成立于2007年,2008年第一家入驻歪歪的培训机构,2014年成为腾讯课堂战略合作机构。
© 2007-2016 我的网站 湘ICP备13004652号-1 Powered by Discuz!X Template by 我的网站 
快速回复 返回顶部 返回列表