当具身智能从实验室走向药房、物流、工厂等真实场景,机器人能否“看得懂、想得快、干得稳”,以及异常情况下能否持续运行,正在决定这笔商业账是否成立。
7月19日,2026世界人工智能大会(WAIC)重点论坛“蚂蚁集团·AGI基础设施与普惠实践论坛”在上海举行,聚焦具身智能、Agent及开源生态从技术研发到产业落地的关键挑战。蚂蚁灵波科技首席科学家沈宇军发布灵波全栈2.0,系统阐释其“具身原生”技术路线。

沈宇军在论坛上披露,蚂蚁灵波最新具身动作模型可实现90-150Hz推理频率,并将机器人支持构型由此前的9种拓展至近20种,覆盖头部、腰部、底盘、双臂及灵巧手等更多自由度组合。团队提出,物理世界与数字世界在传感误差、环境随机性和实时交互需求上存在本质不同,机器人需要面向真实世界重新构建感知、预测与操作能力。

在商业化验证方面,蚂蚁灵波正探索药房分拣、物流分拣和商品分拣等场景。其中,机器人在国大药房一家门店的分拣试点已“初步跑通”,但距离实现全链路自动化、稳定替代人工仍有较长距离。多位行业嘉宾认为,当前具身智能的难题不仅在模型,80%甚至90%的问题仍集中在硬件适配、工程部署、长时运行和异常流处理。
物理世界需要“原生大脑”:看见猫,更要看见玻璃门
沈宇军在论坛上表示,不能将具身智能简单理解为“带有Physical标签的数字智能体”。数字世界中的大模型可以依赖海量文本、图片和代码数据进行训练,而机器人面对的是传感器并不完美、环境时刻变化、任务难以预设的物理世界。
他以“玻璃门后的猫”为例指出,视觉模型或许能识别出“门后有一只猫”,但机器人必须同时理解玻璃门这一无法穿越的物理边界,否则就可能直接撞向门体。
“数字世界和物理世界的需求,从源头就不一样。”沈宇军认为,具身模型不仅要具备语义理解能力,更要在视觉感知阶段强化几何、距离、边缘和空间关系的建模能力,从而支撑机器人在真实环境中完成安全操作。
围绕这一方向,灵波全栈2.0提出“看得更清楚、想得更明白、干得更利索”的研发框架:
- 在感知层,强化几何与边缘建模,以提升机器人对空间边界、物体距离及遮挡关系的判断能力;
- 在预测层,探索实时、可交互的视频生成和世界模型能力;
- 在操作层,提升机器人在随机环境、非标准物料和动态任务中的泛化能力。
据介绍,蚂蚁灵波已与奥比中光开展合作,将相关深度感知模型搭载至相机产品中并实现工业部署。对于具体产品型号、出货量及合作规模,现场未作进一步披露。
世界模型跑上机器人:具身动作模型推理可达90-150Hz
具身智能能否用于真实作业,推理速度是核心指标之一。特别是在抓取、避障、分拣、运动控制等场景中,机器人需要在极短时间内完成感知、判断和动作调整,无法像传统生成式应用一样等待较长的推理过程。
沈宇军表示,蚂蚁灵波最新具身动作模型集成了数据训练、MoE架构、因果预训练、视觉压缩与动作对齐等能力,推理频率可达到90-150Hz。在现场演示中,机器人能够应对桌面足球等存在随机变量的任务,并根据球体运动进行实时反应。
“世界模型通常很慢,但在真实世界里不能等。”沈宇军表示,例如水杯即将倾倒时,机器人若等到物体掉落后再做出反应,往往已经来不及。因此,世界模型能否兼顾预测能力与实时性,是其走向机器人端的重要前提。
与此同时,灵波2.0将支持的机器人构型从9种扩展至近20种。与早期主要聚焦桌面双臂操作相比,新模型可覆盖头部、腰部、移动底盘及灵巧手等更多组合,以适应移动、弯腰、开门、抓取、精细操作等多样化任务。
沈宇军指出,机器人不可能只完成单一任务。只有提升跨任务、跨构型的泛化能力,才能逐步摊薄部署和训练成本,“商业的账才算得过来”。
药房分拣试点初步跑通,全链路替代人工仍有距离
在具体落地场景上,蚂蚁灵波系统工程负责人王志勇介绍,团队正在推进药房分拣、物流分拣及商品分拣等方向,其中药房是当前重点验证场景之一。
药房看似标准化,实则充满复杂性。一家药店往往拥有三四千个SKU,药品形态既包括盒装产品,也包括软包装产品;货架则可能涉及背柜、阴凉柜等不同存储空间。机器人在阴凉柜取药时,需要连续完成开门、识别、定位、抓取、放置等动作,且还要应对昼夜环境变化、货品摆放变化和人为干扰等情况。
王志勇透露,团队从今年年初开始探索相关场景,目前已在国大药房一家门店“初步跑通”机器人分拣流程。但他也坦言,真正实现稳定替代拣药人员、打通药房全链路自动化,仍然“有非常长的路要走”。
“基础模型决定智能的上限,垂类后训练决定智能的下限。”王志勇表示,蚂蚁灵波并非只训练通用模型,而是将基础模型能力与行业场景真实数据、强化学习、硬件适配和业务Know-how结合,通过后训练提升机器人在特定环境中的可靠性。
从Demo到规模化:最大难题是“异常流”和工程化
论坛圆桌环节,多位具身智能从业者对行业现状给出了相对谨慎的判断:模型能力正在快速进步,但距离大规模、低成本、可复制的商业部署仍有明显门槛。

原理灵机联合创始人范浩强表示,机器人进入实际场景后,最难的往往不是“主流程”,而是难以穷尽的异常情况,即“异常流”。例如,机器人是否能够进入狭窄通道、机械臂会不会与周边货架发生干涉、夹爪能否稳定抓住不同物体、相机是否能够覆盖操作视角等,都会直接影响项目成败。
“真正落地时,80%甚至90%的问题其实都是工程问题。”王志勇表示,场景实践的意义不只是获取订单或展示案例,更重要的是将数据、硬件适配、部署流程和异常处理能力沉淀为可复用的工具链。
千寻智能相关负责人则以电池插拔和搬运任务为例称,团队曾花约半年时间尝试在宁德时代工厂部署相关模型,部分场景准确率可达到“两个9”,有时甚至达到“三个9”。但在传统工业场景中,通常需要至少99.9%甚至接近99.995%的稳定性,且如果换一座工厂仍需投入同等人力和成本,商业模式就难以成立。
对于如何区分“精心安排的Demo”和实际部署能力,现场嘉宾提出了几项判断标准:是否支持开放交互、是否能在用户改变物品或环境条件后及时反应、是否具备长时序连续运行能力,以及面对错误和故障时是否能处理异常流。
Agent与具身智能殊途同归:长时任务与自我验证成新考题
除具身智能外,论坛还围绕Agent、强化学习和开源生态展开讨论。与机器人类似,Agent下一阶段的挑战也将从单一任务完成,转向更长时间尺度下的持续规划、执行、纠错和验证。

浙江大学博士生导师赵俊博表示,“所有的长程任务是一场大考。”当任务从几十步延伸至数小时、数天乃至数周,模型的训练机制、过程评估、记忆管理和工具调用能力都需要进一步提升。
美团LongCat团队主任研究员顾奇认为,未来模型与Agent框架不再只是简单调用关系,而将形成更深层次的协同设计,“model和harness会变成一个system去做更深的co-design”。
LobeHub创始人徐文彬则提出,Agent不仅要完成任务,更应具备自我验证能力:模型在将结果交给用户前,应先判断输出是否正确、流程是否完整,并主动进行修正。
2026WAIC《阿里云·Agentic Cloud:智能体时代的基础设施论坛》全文实录
时间:2026年7月19日
地点:上海
主办方:蚂蚁灵波科技
【主持人】
我们下一个是由灵波科技的首席科学家沈宇军给我们带来的,蚂蚁灵波全站2.0打造具身原生的机器人的通用大脑。这是这是我们本月刚刚。这是我们本月开源一周期间发布的完整内容。好的,现在有请。【沈宇军|蚂蚁灵波科技首席科学家】
大家好,我是沈宇军,然后来自蚂蚁灵波科技。对,灵波科技是一家致力于为这个机器人打造通用大脑的一家公司。然后我闲话少说,我就直接开始。然后这是一个我们的整体的一个判断。就是说现在我们的目标是希望说给机器人做一个大脑,那大脑是干什么呢?其实就是机器人想要干活,然后这个大脑就是帮助他理解怎么把事情做的更好。【沈宇军|蚂蚁灵波科技首席科学家】
这里面我们有一个判断,就是说数字世界跟物理世界可能是有一些需求上的不一样的。也就是说我们可能会认为物理世界并不能仅仅停留在数字世界的一个简单的带了physical的一个智能体。我们认为物理世界可能有很多需求,从源头上跟数字世界就是不一样的。然后正是因为这种不一样,所以我们认为物理世界可能需要他自己的重新的这种原生的训练。【沈宇军|蚂蚁灵波科技首席科学家】
这个具体展现在哪些地方呢?首先第一点就是从传感器出发的一个感知的一个问题,为什么呢?因为可能在数字世界,大家已经习惯了,所有的东西都是带真实世界,就是带增值的。带增值的是什么意思?就所有东西我都可以预测,我都可以控制。对,就像那个反正在互联网,然后我们想要什么基本上就可以拿到什么。【沈宇军|蚂蚁灵波科技首席科学家】
但是这个事情在物理世界上其实是不太现实的。因为所有的传感器它天然就是存在误差的。我们不可能期待说一个传感器能达到百分之百的精度。那么在这种硬件的限制下,我们应该怎么做?这是第一个问题。【沈宇军|蚂蚁灵波科技首席科学家】
然后第二个就是高动态的交互,这个是什么意思呢?因为数字世界可能是基本上是可能人与人的交互也是说他没有什么基本上可以说是没有什么偶然性,所有东西我们都是可控的。但是在物理世界,很多东西是没有办法提前预判的。其这个例子其实是我们当时从physical intelligence,他们那个官网就是拿这个例子。很多时候我们可能认为这样,他把那个做咖啡,他认为把那个东西放上去已经好了。但是可能就是因为某一些突发情况,假如那个卡扣没有卡死,然后那个东西就会掉。但这种事情其实数字世界我们可以规避掉,但是物理世界所有就是每天都在发生这样随机的这样不确定的以外。【沈宇军|蚂蚁灵波科技首席科学家】
然后第三个可能我们还是最后希望说一个机器人他不可能只做一件事情。我们不可能为了一个某一个具体的功能去研发一款研发一个大脑。这个大脑最后针对这件事情来做。既然做大脑,我们肯定是希望这个东西尽可能的泛化。能泛化就是我可能要支持各种各样的操作。只有这样批量就是量起来之后,可能成本才可控,商业的账才算得过来。所以从这三点来讲,我感觉可能是物理世界跟数字世界相比需求不一样的。【沈宇军|蚂蚁灵波科技首席科学家】
几个就是怎么说几个观察。然后从这个三个角度出发,其实凌波本身就提出了我们自己的一个想要做的事情。第一点就是看的更清楚,还是说从传感器出发,既然你传感器不完美,我让你变完美。然后第二点就是想的更明白,这个想的更明白,我一会儿会讲一下数就是物理世界想的更明白跟数字世界想的更明白需求到底是什么,有有哪些不同。然后第三点就是干的更利索。其实就是我们尽可能的让机器人操作的时候可泛化,可以应对随机性。【沈宇军|蚂蚁灵波科技首席科学家】
然后下面是我们前一阵发布的模型,这个模型我在这里面就不展开介绍。我们后面就是谈的具体的问题,然后具体聊。第一个就是看的更清楚,当然这个稍微打一个广告,我们其实是现在2.0这个版本已经是可以工业落地的一个模型。它不再是停留在一个,比如说大家在那个可能是调用一下就是怎么样。他是真的,我们现在跟奥比中光有一个合作,然后这个东西是真的搭载就是相当于奥比中光的相机是搭载着我们的模型,真的已经就是从工业界就已经卖到全球各个地方了。对,然后具体他做的就是他实现了一个什么样的功能呢?我大概解释一下。我觉得这个例子是我非常喜欢的一个例子,他能更好的解释我最开始说的数字世界跟物理世界的不同。【沈宇军|蚂蚁灵波科技首席科学家】
就是可以看到左边这个例子是一个玻璃门,玻璃门后面有个猫,这个是一个RGB拍出来的图。中间可能是用光学,就是一些传统的光学算法,然后解算出来的深度是大概长什么样子。然后右面那个是我们做了就是用我们的模型做了深度增强,增强之后是机器人再看到的深度的样子。【沈宇军|蚂蚁灵波科技首席科学家】
对这个为什么我说我特别喜欢这个例子呢?大家可以观察到有一个细节,就是在这个玻璃门没有打开的时候,就是可以同步看右面那个。在玻璃门没有打开的时候,其实这个猫是并没有出现在画面里的。【沈宇军|蚂蚁灵波科技首席科学家】
我解释一下为什么会有这样的问题。就是数字世界其实如果说看这个视频,你让大模型去为这个视频打一个标签,他肯定会说就是看到了一扇门,然后这个门后面有一只猫。这是这个是基本上所有大部分都能做到这件事情。但是为什么我认为这个事情在物理世界不合理呢?因为这个猫虽然你能看到,但假如说你给机器人一个指令,说你去逗一下这个猫,机器人根本做不到。因为中间有一道门,这个门不是你能看到就行了,你要知道有一道门你过不去。【沈宇军|蚂蚁灵波科技首席科学家】
从距离来讲,对机器人就是从这个decent来讲,我从视觉上我可以看到它,就是说vision这个模态是可以看到猫的这是semantic,就是语义级别。但是如果从3D这个level,我们应该看不到这只猫才对。因为你如果看到那只猫,你就会撞到这个门上。我觉得这个是很好的,我认为是一个很好的很生动的例子来解释为什么数字世界的需求跟物理世界的需求天然是不一样的。【沈宇军|蚂蚁灵波科技首席科学家】
然后其实为了做为了达到这样的效果,我们就是从基本上是从机模开始做起。因为大家很多视觉的预训练用的是dino,就dino v2V3大家都在用。但是dino它或者说大部分的是这方面的预训练。如果他是为了数字世界做的,基本上还是停留在语义级别。他的语义做的现在已经非常好了,做detection、segmentation、classification其实都做的非常好。但如果我们真的想把这种语义信息往深度信息往距离这个方向去迁移。其实现在大部分的视觉机模还是有一定的困难。就是说他能做,但是效果不一定做的很好。【沈宇军|蚂蚁灵波科技首席科学家】
我们这个是从整个视觉机模的训练就开始,就相当于我们抛弃掉了dino,我们没有在用dino那套范式,而是从边缘的角度去建模就可以看到其实我们说白了说一个通俗易懂的,就是我们在检测一张图里面的点有哪些,面线有哪些,说白了就是检测边缘。我们认为你只要边缘检测好了,因为边缘本身就是几何,几何是最容易转化成距离的。也正是因为有了这样的预训练,使得我们在深度这种比较dance的prediction上有了非常大的提升。【沈宇军|蚂蚁灵波科技首席科学家】
对这个是从看得更清这个角度我解释就是我想尽可能的去讲一下,我为什么觉得数字世界跟物理世界不一样,以及物理世界为什么需要它独特的预训练。好,这是第一个点。然后再说一下这个可以帮我静一下音吗?好,谢谢。对,再说一下这个想的更明白这件事情,这个是这样,我这里面我们不谈它到底是世界模型还是怎样,其实想的更明白了,更多的其实是对未来的一个预测。说白了就是视频生成这个方向。我们就在视频生成这一个领域里面,去讲一讲为什么我觉得物理世界跟数字世界需要的是不一样的。数字世界大家可能可以想一下,就是这个现在可零也好,c dance也好,其实做的已经非常不错了。【沈宇军|蚂蚁灵波科技首席科学家】
然后那他的实现的功能是什么?就是你给他一句话,他给你一段视频,这个中间人是可以等。第一个是人是可以等。第二个是整个这个视频的内容,其实是在我最开始输入的时候,他已经全部知道了。就换句话说,他在生成整个视频的时候已经知道结局是什么了。但刚刚我已经说了,就是在真的生活中,我们很难说做任何一个动作,把它的结局完全就预判好。很多东西是要实时的,就是我要我不知道会有什么样的随机性,发生任何事情都可能变化。同时在真实世界里面我们是不能等的。【沈宇军|蚂蚁灵波科技首席科学家】
我不能说我现在这个水杯要洒了,因为马上要掉到地上。然后我等着我预测,他要掉到地上,然后我这个时候再说,我要把这个杯子扶正,来不及。所以说从数字世界来讲,我们可能期待这个视频非常有想象力,质量要非常的高。但是反而从物理世界,我们希望的是这个视频一定要快,而且一定要有所为了。因果这里面我们不说他这个因果是不是真的理解了因果。我这里面英国更想讲的是,就是我们站在未来可以看到过去,但是站在现在是不能看到未来的。就是我们永远不可能提前预判结局是什么。【沈宇军|蚂蚁灵波科技首席科学家】
这个点对所以说从这两个点上,我们团队做了两个工作,分别来解决这两个问题。第一个就是这个Linda video,其实它最最核心的点解决的就是MOE的训练问题。因为现在大家所有能拿到的开源的比较好用的这个视频生成的基座模型,基本上都是都是dance架构的。我知道现在业界应该有很多就是像可零c dance,他们可能已经是MOE架构了,但是这些架构都是必然的那好在这样的情况下,如果说具身智能想要往前发展,我们希望模型的推理效率要高。【沈宇军|蚂蚁灵波科技首席科学家】
然后数字世界没有给我们一个开源可用的模型,我们应该怎么办?我觉得一个很直接的方法就是我们要自己把这个模型干出来。这也就是为什么我们有了今天这样一个工作。我不能说他就是我们这个东西,不是说他的生成能力跟就是现在特别顶尖的一些模型有多大的多多大的这个优势,并不是这个道理,只是说现在物理世界需要这样一个东西。那么好,我们就从问题出发把这个东西做出来。并且我们这个模型是开源的,因为我们觉得生态也需要这个东西。好,这是第一个问题,就是我们想要解决推理效率的问题。【沈宇军|蚂蚁灵波科技首席科学家】
第二个问题就是他稍等,对他就这个第二个问题就是我刚刚说我们所有的东西其实都是不可预估的那给模型一个什么样的能力,就是给模型提出了一个什么样的需求呢?就是这个模型需要随时能够拿到一个外界的信号,基于这个信号就要做判断,他必须要接受这种不确定性的输入,所以它必须是一个可交互的模型。而其实我们一月份的时候就已经发布了一个limbo word。但当时那个模型交互能力相比,跟现在这一版跟上一版比有了一个非常大的提升。就是它可以支持,基本上小时级是我们自己测过肯定没问题。但是我们感觉它可以一直玩儿下去。因为它解决的就是你能不能从训练开始就用单向的attention,所谓的靠嘤嘤国注意力机制来让这个模型取得一个比较好的效果。它解决的是这样一个问题。【沈宇军|蚂蚁灵波科技首席科学家】
然后可以看到就是中间,而且包括这一版,我们其实加入了非常多的可以交互的元素。除了大家经常看到的可以前后左右移动,可以调画面的这个视角。除此之外我们可以输入tax prompt,就是随时你给他一个新的tax,你让它生成一些什么东西,可能画质里马上就会出来了。然后同时我们还支持一些特效,跑跳很多动作。【沈宇军|蚂蚁灵波科技首席科学家】
另外我们同时还给这个模型配备了一个agent,这个agent可以同时随时给你推荐说他接下来可能会发生什么动作,它会有一个大概的预判。对,就是整体看起来是非常像打游戏。但它其实核心解决的那个能力就是你能不能够随时的接受到一个外界的不确定的信号,基于这个信号做反应,这个事情对于机器人来说是至关重要的。【沈宇军|蚂蚁灵波科技首席科学家】
所以说从这两个刚刚这两个工作的角度来说,我们其实就是很多人可能会就我最近也是被被很多人问到,就是说这些模型到底有什么关系。但其实我在这里面想,正好借这个场合,我想表达一下我的一个看法。就是每一个现在灵波做的模型,它代表了我们沉淀下来的一种能力。而这些能力可能最后会汇总变成一个大家可能期待的最终的模型。但是在最终那个模型出来之前,一个能力我们想要有和你真的具备,我觉得是不一样的。也就是所谓的说一会儿我们会说原声。【沈宇军|蚂蚁灵波科技首席科学家】
我觉得物理世界或者说具身的原生,讲原生是态度,做原生是能力。我觉得这一次我们更多的是想给这个社区展示说物理世界需要这样的能力,而且我们在一定程度上取得了一些进展。然后这个是说刚才想的更清楚这两个点。然后接下来就是我觉得更可能是更更我觉得更重要的一件事情就是干的更利索。【沈宇军|蚂蚁灵波科技首席科学家】
为什么说干的更利索这件事情,机器人或者说物理世界跟数字世界有比较大的不同呢?因为物理世界在这方面的数据积累基本上是空白的。大家知道就是数字世界是因为互联网发展了几十年,有非常多的资产沉淀。但是在物理世界上,我们需要什么样的数据?需要哪些模态?每个模态应该是一个什么样的质量需求?所有的这一切都没有标准,大家都是在摸着石头过河。【沈宇军|蚂蚁灵波科技首席科学家】
在这种情况下,我们有我们还做了所谓的VLA这么一系列的工作。VLA的工作核心是为了做什么呢?核心就是为了弄明白机器人到底需要什么样的数据。【沈宇军|蚂蚁灵波科技首席科学家】
这里面我分享两个我自己的一个观察。就是之前或者说大家现在见到的大部分的机器人的demo基本上都是桌面操作。就是双臂也好,或者说一个人站在那里也好,然后在在桌子上放一堆东西,不管是给别人观看也好,还是他自己在那做也好,就是在桌面层操作。我们之前也是这么干的,1.0版本我们就是这么干的。【沈宇军|蚂蚁灵波科技首席科学家】
然后在1.0出来之后,我们再尝试把这个机器人,就是所谓的这个大脑落地的时候,我们会发现遇到了非常多的问题。比如说有些时候可能我们需要机器人抬手做一件事情,在采数据的时候完全没有想过这个点,就是没有踩过机器人还需要抬手这样的例子。那那你说抬手的时候,机器人的摄像头已经看不到他的手了怎么办?再举个例子,机器人有些时候需要弯腰做一个动作,因为它够不到。那好没有踩过腰部移动的例子,之前采的所有数据都只有双髀。【沈宇军|蚂蚁灵波科技首席科学家】
所以说就是在经过了1.0,然后再尝试着把1.0的模型落地的过程中,我们就发现我的天啊这个实验室环境完全跟真的产业不就是怎么说呢?天差地别。我们想要它有头部的自由度,想要它有腰的,想要它有零敲手的自由度完全没有。也就是基于这个考虑,我们在2.0的时候,核心对我们之前1.0版本的数据管线也好,采集链路也好做了一次升级。【沈宇军|蚂蚁灵波科技首席科学家】
这一次我们从之前的九种构型支持到了将近20种构型,然后自由度也从原来的只有双臂操作,现在支持到了头部的、腰部的、底盘的,甚至包括绫销售的自由度。就是因为当然数据量是一方面,就是因为有了这样的一个打底的工作。我觉得可能是我们在具身原生或者说机器物理世界读书的数据上也往前迈进了一些脚步。然后这边可以看一下这个结果。【沈宇军|蚂蚁灵波科技首席科学家】
然后这里面我也稍微打一个小广告。因为那个模型我们一直在迭代,然后发布的时候其实已经月初,然后经过了又半个多月的时间,其实这个是当时这个是上一版模型最右面这个我们的1.0版本,然后2.0版本在这,其实左边我们又多列了一个,这个可能在技术报告里都没有。这是我们最近因为模型一直在迭代,其实它又能看到随着数据的进一步提进一步积累,然后模型训的更久。其实我们在整个的任务的成功率上又有一个相对明显的一个提升。这个我觉得核心还是说我们做的每一个模型是为了解决一个问题。做VLA就是为了解决物理世界数据的问题。好,就是有了刚刚所有的一切。我们最后在发布的最后,我们当时推出了一个我们叫具身元生的世界动作模型,就是VA2.0。【沈宇军|蚂蚁灵波科技首席科学家】
它集成了刚才我们说的很多能力,比如说数据的能力,比如说MOE的能力,比如说英国训练N英国预训练的能力,再比如说他自己独有的一个VIE的能力。对这个VIE跟大家市面上能用到的开源的VIE不太一样的点是大部分的开源的VIE只做视觉压缩。但我们在视觉压缩上又进行了语义的保持,以及对action的这种alignment,就是对action的对齐。因为我们最后的这个token either,或者说这个VIE,我们之后是希望他能够服务机器人的。所以说这个地方我们也做了一个改进。就是因为有了这些所有的这些能力,然后我们尝试着把它揉到一起,重头训练了一个为了机器人而生的具身动作模型VA2.0。【沈宇军|蚂蚁灵波科技首席科学家】
然后这里面可以感受一下它的效果,其实我比较喜欢的就是这个左边这个跟我也不知道这个具体的是什么,可能是桌面足球。我不知道这个游戏本身名字叫什么,但我是非常喜欢这个例子的。因为这个东西是没有办法提前就是像demo一样,我把所有的路线都规划好。因为我人创一下那个球,我也不知道那个球去哪了,这是第一个点。第二个点是就是因为我们做了推理上的加速,在包括我们架构上也做了加速。这个视频是完全没有做任何加速的,可以以这样的执行频率。【沈宇军|蚂蚁灵波科技首席科学家】
大家都知道世界模型很慢,没有人现在尝试把世界模型布到机器人上。但是我觉得我们现在基本上做到90到150赫兹应该是没有问题的。所以我想用这个例子来说明,可能我们一直讲具身原生具身原生也说了一下,为什么物理世界跟数字世界的需求不同,物理世界需要自己的机模。通过这个例子我就想说,我个人认为这条路虽然可能是一条比较艰辛的路,但我相信它一定是个正确的路。因为所有的东西你都从头开始预训练它,一定是不如拿一个已经训的差不多的模型来做一下fine tune,然后做一下其他的东西,我觉得要来的快,肯定不如那个方式快。但我觉得如果要走得远走得稳的话,因为数字世界跟物理世界的需求不同,所以有一些东西是我们必须要经历的,有些坑是必须要汤的对,然后差不多我就分享到这里。然后这次外壳我们也是有个展台,在H3展厅的B302,然后也欢迎大家可以去参观,好吧,谢谢大家。【主持人】
谢谢谢谢沈宇军的精彩分享,他要去赶下一场了。真的很忙。然后继续接下来我们会继续我们的这个具身的环节。从感知到理解到决策是一个很复杂的一个过程,然后我们还有很多的问题大家可以继续试深入探讨,我们下一个环节有请我们的圆桌的主持人,具身研习社的联合创始人和主编吕鑫燚。然后还有原理灵机联合创始人范浩强,千寻智能预训练负责人郭俊良,以及灵波的系统工程负责人王志勇。
【吕鑫燚|具身研习社】
好,大家好,我是具身研习社的联合创始人兼主编吕鑫燚。今天这个话题我个人特别喜欢,我觉得这是一个非常落地的话题,很有探讨的价值。在正式开始之前,我们先请各位嘉宾做一个简单的自我介绍。从范老师开始。【范浩强|原理灵机联合创始人】
大家好,我是原理灵机的范浩强。原理灵机是一个致力于做具身智能的机器人产品以及解决方案的公司,目前在北京。谢谢大家。【郭俊良|千寻智能预训练负责人】
大家好,我是千寻智能的郭俊良。我们千寻智能前期主要做全栈,然后逐步向大脑能力演进。我在千寻智能负责预训练,就是负责了spirit VLA系列的模型的研发。【王志勇|蚂蚁灵波科技系统工程负责人】
大家好,我是蚂蚁灵波的王志勇。蚂蚁灵波定位做具身智能的基座模型,我在蚂蚁灵波负责相关的工程技术,谢谢大家。【吕鑫燚|具身研习社】
好,感谢。我们今天三位嘉宾的标签,背后公司标签其实还都挺统一的。虽然说有的有本体,但是更多的还是以模型为主。我们今天就从模型的角度上来看,从各位的视角上来看,说哪些实体产业目前更适合具身模型来落地呢?从方老师开始。【范浩强|原理灵机联合创始人】
就是一上来就到这个最最深刻最核心的。【吕鑫燚|具身研习社】
我们先从核心了解。【范浩强|原理灵机联合创始人】
我们总结过就是说现在具身它适合做一些什么样的任务。我们总结了几个requirement,其中第第一个是说他要对这个节拍不敏感。第二个就是说这个事儿他要能够有一定的容错性,然后另外的话,他还是要能够有一定的变化的。【范浩强|原理灵机联合创始人】
其实这主要是回答一个问题,就是之前这非标自动化科技实在是太厉害了,可能我们能想象到的绝大多数任务,你只要带着需求去趟深圳,可能一个多月之后一定能拉出来一条产线。然后那些推杆儿、气缸什么的,乒乓乓乓一共有一定干的出来,那就是说其实具身是在夹缝中给自己找到这个应用。所以刚才我想说的是有那些对场景的选择性,其实它也是要顺应具身的它的趋势。那就是说它的执行的可能不是百分之百成功的,并且可能有可能像这个系统里本身就引入这个呃不确定性,但是它有很好的适应能力,比如说我们可能去非标自动化拉回来的这么一条产线,你想把这个加工工件改出一个毫米,那可能就又得重新全都又改变了。但是说具身的这个技术的话,它有可能可以以很快的速度去适应这种新的物料等等的这些需求。我们之前经常就举一个例子说说做了一套系统能做可口可乐,万一明天要换成百事可乐了怎么办?就是如果他能以比较低的成本泛化过去,那可能这个对于去升级其实来讲就是一个很好的一个这么一个应用场景的这个方向。【吕鑫燚|具身研习社】
感谢您的回答。其实您刚刚所有的回答默认的一个大前提是在工厂端,工业端。那如果我们在从商业端或者是说其他的实体经济。【范浩强|原理灵机联合创始人】
现在我听说两种有趣的说法,一种比较落地,说是具身智能。第一大应用就是唱歌跳舞,只不过但是我们公司人都不太擅长这个事儿。然后第二个是据说是mask说说具身的第一个应用是去月圈造基地,因为你不造基地,上不去,人不上人,造不了基地,所以说具身机器人只能上他了,我觉得他们都说的很对,但是这事儿可能跟我们这个关系不大。所以说因为我们还是想从生产力的这个角度去思考,就是说机器人怎么能更好的帮人干活,之后这样人腾出更多时间,就可以唱歌跳舞,吟诗作画,可以去更好的去享受这个生活。所以说从这个角度讲的话,可能从我们这边我们会更多的去看这种以生产力为核心的这些场景。【吕鑫燚|具身研习社】
好,感谢。我觉得千寻的答案应该会更多元化。因为我们又有零售的场景,然后又有工厂的场景。从您的角度上来看。【郭俊良|千寻智能预训练负责人】
首先我觉得这个问题是也是一个非常核心的问题。然后也是我觉得可能现在谈这个问题都是有点早的问题。可能我们之前去做过很extensive很多的调研。然后我们可能去想这件事情的时候,我们会首先会想需求,就是说首先你这个场景它是不是比如说人力密集型的,它需不需要你的机器人去干这个事情。比如说我觉得刚才小翔总提的这个LOMASK这个火星,这个就非常对,就是因为人干不了这事儿。【郭俊良|千寻智能预训练负责人】
但是可能回到我们这个具身的这块,就是很多需求。比如说像仓储,像一些商服,包括可能未来会有的一些养老,然后陪伴的这种需求。他需求在哪?而且可能很迫切,但是你模型能不能干好,那是另一件事。【郭俊良|千寻智能预训练负责人】
所以第二件事就是说可能我们的模型能做到什么。我们去年也是去花了可能大概半年的时间,去把我们的模型在宁德时代的工厂里去落地,然后去做电池的插拔。它可能首先它确实是有这个需求,因为它的这个不是一个标准化的产线,它可能需要在不同的工位之间移动。那个电池那玩意儿特别重,所以就是需要机器人去做一些插拔、搬运,是他的需求在这儿。我们尝试把它做好。半年之后,我们可能发现,我们模型做的还不错。可能能到比如说两个九有的时候甚至三个九的这个场景的准确率。【郭俊良|千寻智能预训练负责人】
但是这个准确率在可能传统的工业上,它其实是非常低的。就是可能工业上它要求准确率可能是至少三个九,甚至99995个九这种。那就是我们最后得到的结论,就是说我们的技术现在这一套链路,它可能能做到一个就是有一个需求,然后你去应对它,你是能做到的,但是你挣不了钱,因为你没有外卖scalable。就是你换一个工厂。比如说我在宁德做完,我去比亚迪做,那我可能还是要需要同样的effort,同样的cost。对那这个飞轮转不起来LI这个算不正的话,那可能目前去做这件事情其实是有些困难的。【吕鑫燚|具身研习社】
好,感谢大家。【王志勇|蚂蚁灵波科技系统工程负责人】
从灵波科技的角度上来讲。因为对我觉得大家的共识其实比较多。站在远的地方来讲的话,可能千行百业、千家万户都需要去生成的。但是就像一个锤子和钉子的问题,从需求端的话,我理解很多地方都有需求。但是可能当前的问题还是说我们的这个能力,或者是聚成这种能力还比较早期,可能有点类似于这个GPT3这个阶段。所以我们其实也找了很多场景。最后其实选择的就是我们认为分拣类的场景,那可能是比较适合当前去落地的,主要的就是会包括这种物流的分拣,还有这种这种商品的分解,类似这种场景我们也在探索落地的过程中间。【吕鑫燚|具身研习社】
感谢,刚刚回答其实已经非常全面了,其实有偏特性一点的,比如说节奏节拍不要求不高,然后比如说更具体的工作流分拣这些任务。五从我们真实,因为据我了解三家应该都有在场景中去落地了。从真实的角度上来看,目前最大的难关在那儿。从王志勇老师开始。【王志勇|蚂蚁灵波科技系统工程负责人】
最大的难点吧?对,其实从那个具体的场景来看,其实比我就直接举个例子。比如说我们现在我们现在其实是两个场景的选择,一个是我们自己在探索和这个国家药房的探索,这个药房分拣的这个场景。其实从它的场景来看的话,就是它本身这个场景其实是一个半结构化的场景。因为从你像从买药的角度,从用户的这个问诊到下单,到分拣以及到最后的打包整个这个过程,它其实是一个前面的问诊的环节和后面的拣货环节,其实它是比较非标准化的。但中间的下单的环节,因为过去这么多年的数字化的一些努力的话,其实相对来说比较结构化。所以这个过程中间其实你会发现很多的难点是第一个,问诊,这个时候刚好蚂蚁有这个阿福,所以我们认为这个是我们可以触发的一个点。【王志勇|蚂蚁灵波科技系统工程负责人】
在具体的分拣场景的话,我们发现就是说他去首先他要面对各种不同的药品,可能一个药店它可能有三四千的SKU,你去选择什么样的药品。第二个,每个药品它其实它的构型或者它的形状有这种盒装的,有这种软包装的,各种包装其实不一样。第三个其实是他的放置的这个货架,他有那个背柜、阴凉柜,还有传统的货架。尤其像那种阴阳柜,它其实机器人要打开那个玻璃去拿,这里面其实是挑战是非常大的。【王志勇|蚂蚁灵波科技系统工程负责人】
第三个第四个其实还有时间的维度,就是因为白天和黑夜,白白天或者晚上这个药房面临的挑战都不不一样。所以从我们实际落地来看的话,这里面的每一个环节它其实挑战都非常大,我们也是从今年年初开始一直在探索,中间也踩了很多的坑,然后现在在国大药房的东京路那家店,我们已经初步跑通了。但是真的要实现真的去替代一个简要的工作人员,甚至把整个。全链路打通,我觉得还有非常长的路要走。对。【吕鑫燚|具身研习社】
谢谢。好,感谢。从郭老师我。【郭俊良|千寻智能预训练负责人】
特别认同王老师刚才的说法,就是说现在的面临的这个场景,它其实是一个半结构化的场景。他其实意味着说我们整体的面临的环境,然后包括刚才说的不同的SKU,不同的物品,然后它的摆放,他们的diversity是非常高的。但是同时我们这个半截会构化的意思就是说他最后的要求就是他对于精度的要求其实也是很高的对,就是这件事情他有着可能传统自动化的一些最后的准出的一些要求,但是他的这个场景却比传统自动化会非标很多。所以这个对我们模型的能力,包括你素材的这个能力,素材的量,模型的方案性都提出了非常高的要求。对。【吕鑫燚|具身研习社】
好,感谢南方老师。【范浩强|原理灵机联合创始人】
就说确实落地难点在那儿。对我觉得最直观的感觉还是这个模型不大够用。然后刚才说的时候,我们进入到GPT3的这个阶段了。但是我想说如果我们对未来足够乐观的话,我觉得现在可能刚刚到alex net那个水平。就是在这个水平之下,说实话他能能可靠的work的部分可能还是比较有限的。【范浩强|原理灵机联合创始人】
当然是就是真进入到实际场景之后会发现,如果你这问题里只卡在模型上,这简直是天下第一快乐的事情。因为一般来说你去了场景之后,第一件事发现的机器人他根本就进不进去,通道太窄了。然后好不容易进去的时候,我一想抬手发现周围全是碰撞和干涉。完了货架,然后等这事儿解决了之后,然后下一关就是说你的那那东西到底夹不夹得起来,最后就是好不容易这件事搞定了,最后发现自己原来装的那几个摄像头其实根本看不见你正在操作东西。就等克服了这九九八十一难之后,最后发现这个可算现在是个模型问题了。这时候可能发现这项目已经干了80%了。【范浩强|原理灵机联合创始人】
所以我觉得是说具身落地的这个难度,它叠加了两个层级的这个难度。一方面是说真实世界的确是非常复杂的那我们就是说用一个金属去做的这么一个机器人去完成这个任务,他有自己物理上的这个难度。第二方面就是说,现在的这个模型其实他还没有做到可以发挥超高的智能来去弥补刚才说的这些问题。然后我有个很具体的例子,比如说就是说叫那个药,就是去药店就是拿药盒。对,为什么讲这个?因为现在很多人去展,比如说集群自动零售或者什么,他们有共同特点,就是如果你要卖水,那水瓶和瓶之间一定要隔得好远,为啥?那爪子都是横着进去夹的,你不留个缝儿肯定夹不出来。【范浩强|原理灵机联合创始人】
这时候我觉得大家可以再做个实验,就是你想象一下你是怎么把一个放在桌子上,手机从手上拿起来的,然后经过我的这个分解,这动作非常的科幻。第一步你会先两指扣住它,然后其中一指发力形成了捻动的动作。然后在半空中的时候,第三指接力给它夹住,然后再一扭,最后再弹到手心里。就是说人类能把就是能就是能生活,这简直是一个智能史上的奇迹。我觉得就这么一个简单的动作,你仔细拆开看,发现你真是调动了几十年来的智能积累,然后靠你的五个手指头把它完成了。但是说如果以这个为具身的目标的话,我觉得我们现在可能真的也就是alex net的一个水平。想让机器人在自己很有限的这些硬件情况下去调动自己的质疑,来发挥自己全部的物理潜力去完成任务,我觉得这个路还是挺长的。【吕鑫燚|具身研习社】
好,感谢。我们刚刚聊的都是一些偏宏大的趋势,我们现在来稍微再聚焦细细化一点。从各位的角度上来看,针对于实体产业或者说场景本身,就是作为模型企业,它是应该做一个基座通用的基座模型,还是专门针对不同的市场去做不同的垂类模型。比如说工业,它就是应该有一个工业大脑,零售它就应该有个零售的大脑。还是我们奥运万一个就够了。那从范老师开始。【范浩强|原理灵机联合创始人】
对我的观点可能下来比较偏偏见。我觉得就是现在很多人问说具身就是采什么数据有用?我记得回答就是说采啥数据都有用。因为现在啥数据都还积累的还都比较少。【范浩强|原理灵机联合创始人】
很多时候我们看一个技术的发展,很多时候他是早期的时候,可能所有的这些进步和演进都是统一的那比如说我们从x net走向RESNET,那你无论是去做工业,去医学,去做什么的,你会发现它技术都普遍性的能够变好。我觉得现在具身可能还处在这么一个非常快乐的这么一个阶段,那就是说我们从模仿学习,然后细化到VOA,然后又现在又发展出了world model RL等等这些科技网上叠加。可能这个也许无论对于我们将来做任何的应用来讲,它都是一个基础的组成部分。那就是现在它还处在一个没有去进行分化或者分裂的阶段,也许将来比如说某些东西他真的做work了,那可能就不得不分出来说,这是给居家用的技术,这是给工业用的技术,这是给谁谁用的这个技术。但我觉得现在的这个发展阶段可能还处在这么一个早期的这么一个混合在一起的状态。这个反过来说,现在要去研究,一定得想说,我想的这招儿得是对这些大多数的任务都起作用了。可能这才是现在该去研究的主线问题,而不是说上来我就去研究,是说抠成某个东西具体该怎么做,只要你肯用这个加sam,然后再写写pioneer and control,说实话没有什么做不出来的demo。但是说现在如果把时间花去做这个了,那一定是啊没有放在去最终实现集成智能的主线上的。【吕鑫燚|具身研习社】
所以您认为是先用起来,先甭管他这个模型是怎么样的。【范浩强|原理灵机联合创始人】
不是,还还是还是得沿着正确的方向去走。比如说现在的那大家都说强调去搞预训练,那是不是说预训练训练好了之后,这东西他就什么问题都解了,那那肯定还没到这个阶段。但是说现在如果不去研究与训练的话,那那将来只会去绕更大的弯路去去解决这个问题。【吕鑫燚|具身研习社】
好,感谢。【郭俊良|千寻智能预训练负责人】
从郭老师角度来看。我其实对于小强老师最后的判断,我会有一些不同的意见。我觉得即便是到了最后,可能过个五年十年的,就是我们的预训练的模型基座模型它的能力到了一定程度之后,我们可能最终还是需要去去有各个垂类的模型。只不过跟现在的区别就是说这些垂列模型它必然是从这个预训练的模型去演进出来的,所以就是在我们现在这个阶段,我觉得这个问题非常的明确,就是我们现在模型就是太差了。然后就是我觉得可能alex net有点太早了,是不是就是什么。【吕鑫燚|具身研习社】
是不是可以VGG?【郭俊良|千寻智能预训练负责人】
对我我觉得可能是不是就是快到image net的出来那时候了。就是因为我们像今年,像刚才蚂蚁,像很多的不同的公司,包括千寻,我们都在大量的去采集数据,有不同的方案。什么UMI甄姬,什么ego。我觉得到明年之后,我们可能市场上的这个数据量它会怎么报了一个台阶。那这个台阶之后,我觉得可能是不是有可能去涌现出类似GPD1、GPD2这种的时刻。然后可能再过个几年,我们把模型去做scale,各种scale,然后我们到GPT3的时刻。【郭俊良|千寻智能预训练负责人】
对然后我觉得到那个时候,我们可能期待这个模型它的效果是说他可以zero shot去完成一些不同的任务。然后那我觉得可能等模型有这个能力之后,他比如说zero shot去在这个工厂,比如说做一些拣选,然后在那个工厂做一些上货。那他可能zero shop都能有50%、60%成功率。那这个时候我觉得可能我们再去develop一些垂类的模型,它才变得有价值。因为它本身才变得scalable,然后它的deploy的成本才能去变小,然后它最终才能去达到比较好的效果的同时,它减轻它的cost,才能去挣到钱好。【吕鑫燚|具身研习社】
感谢。我想再追问一下您刚刚提到的那个锤炼,再去做锤炼模型,这个锤的有多垂?是锤到工业跟零售,还是垂到某一个像车那个等级厂生产线。【郭俊良|千寻智能预训练负责人】
我我觉得这个锤应该就是蛮锤的。就是说这个可能是在商超,比如说我们可能按场景分,对,那可能商服务它是一个场景,比如说这个商店,那个超市,或者就是酒店,他就是这个酒店,那个酒店。比如说我们现在能做到的是,可能对于所有的全季,他的房间都差不多,那我们可能能去最先去做一个落地。但是可能到之后我们开始做锤炼的时候,可能就是对于不同的酒店,因为它其实做的事情是类似的,但是它场景会有一些泛化性的要求。我觉得就是我所谓的垂类,其实是这种垂类就是说可能它的场景类似,它的任务类型类似,只不过他的这个他的这些物品摆放,他的一些编排会有一些区别。【吕鑫燚|具身研习社】
好,感谢。王老师【王志勇|蚂蚁灵波科技系统工程负责人】
我个人觉得那个机动模型决定它的智能的上限。但是垂类模型决定它的下限,其实所以我们现在走的路就是因为首先蚂蚁来成立这家公司,就定位做几种模型。所以我们肯定是一方面肯定会虽然很难,但还是会不断的去探索怎么样把基层模型做好。但是第二个,在具体场景落地的时候,其实可能不是说一个单个的垂纶模型。【王志勇|蚂蚁灵波科技系统工程负责人】
我们现在大概是怎么做呢?首先第一个肯定会有一个机制模型,但在具体场景上肯定会有一个基于基础模型之上的后序列,其实就是拿这个场景的一些真实的数据去做一个后训练。第三步可能还是会要做一些真题强化,这一条路其实我们已经跑下来了。所以可能不一定说是那种比如说某一个领域的这种垂类模型,而是说某个场景的垂类模型。所以我可能不知道跟大家理解有有一不一致,但是反正我们觉得首先我们会坚定不移的去做这个机座模型。第二个在落地的时候,其实我们会把对应的场景里面的know how都沉淀到这个模型里面去,也沉淀到整个的这个工具链里面去。【吕鑫燚|具身研习社】
好,按照您刚刚说的那个逻辑,其实这也是前段时间比较火的一个话题。那对于趋势模型企业现在来讲,我们是应该去迭代机组模型,还是应该先去到场景里面去。这其实另一个角度上来看,就场景能耗到底是相对重要还是非常重要。从王老师接着开始。【王志勇|蚂蚁灵波科技系统工程负责人】
我理解这个事情就是他一体两面。你不太可能说我专门去做机动模型的研发,不进到场景里面去。哪怕我们现在定位做机动模型,我们也要到场景里面去。因为你不到场景里变成一家科研机构了,你最后就是不断的发模型,但实际上离他最后的落地越来越远。【王志勇|蚂蚁灵波科技系统工程负责人】
第二个就是说行业的落后非常重要。但是现在可能还没到,就像刚刚那个方老师说的,现在其实我理解可能都不是一个目前来说不是一个特别大的瓶颈。因为现在其实我们真的在行业里面去用到的一些东西可能还比较简单。但是我们会更多的说在这个场景落地的过程中间去第一方面去检测我们的这个底座的模型能力到不到位。第二方面其实只是说我们在这个过程中间,其实要不断的去把一些数据回流做累积。【王志勇|蚂蚁灵波科技系统工程负责人】
然后过程中间会有很多工程化的问题。这个就像刚刚花老师说的这里面其实真的在落地的时候,有80%甚至90的问题,其实都是工程的问题。那我们工程的问题能不能沉淀到一套工具链里面去?能不能把中间我们踩的坑都一个的沉淀到这套工具院里面去?这个我觉得是有非常长的路要走的。【吕鑫燚|具身研习社】
谢谢。好,感谢郭老师。【郭俊良|千寻智能预训练负责人】
我觉得这个确实是一个trade off的问题。就是在这个发展的过程中,我们肯定不能同时既要又要,但是也不能只要一个,不要另一个。【郭俊良|千寻智能预训练负责人】
就像刚刚说的,我们可能现在是处于比如说我们有了一个image net这样的数据量的一个积累之后,那可能我们的模型每一步的演进,可能在这个时候我觉得我们应该focus在机膜的研发上面,可能我们应该投入更多一些。因为这个时候其实你focus在这个上面,他对于你比如说即便你要去做这个落地的一些应用,它的这个收益也是最高的。因为你这个时候focus在,就像刚刚说的,我们可能focus在某一个场景的落地应用的时候,你的这个know how他可能不scalable。因为你的know how有可能有一些是错的,就是因为我们现在模型可能能力太差了。然后我们的fix一堆bug之后,它它达到一个比较好的效果。但是也有可能就是我们scale了十倍的model,scale了十倍的data,那他可能根本就没有这些问题。所以我觉得可能从现在来说,我们比如说我们大概是80%会投入在技术模型研发上,20%可能会投入在我们跟我们合作方的一些场景的探索。上好。【吕鑫燚|具身研习社】
感谢南方老师。【范浩强|原理灵机联合创始人】
对关于这个对我听过就是一个视角。就是有些事儿它是场景找模型,有些事儿它是模型找场景。好多时候技术如果比较成熟,我们针对这个问题就说想解决它,把它用起来了。那那是去想我一下什么模型最合适。我现在阶段往往是说我先把模型训出来之后,看看他能干啥前段时间的话,我们公司也推出了一个叫mass服务。就是说你也别后训练了,我就有个API,你就可以直接调。【范浩强|原理灵机联合创始人】
你说是不是说所有任务添加一定的动作,那那肯定不是这样的。那为什么说现在放出来的?其实我们也想让大家试试,就是天下是不是已经有点任务可以做了,很多时候就是说他就看大模型,其实说实话现在哪怕发展到GPT-5.6之后,说实话做很多原来的传统视觉任务还是打不过原来那些模型。但不妨碍他说找到了像类似像coding,像agent这样很好的应用。那就是后面去进一步牵引,是说具身模型每一小阶段的这个milestone在哪里?我觉得很多时候可能也得去重新放开了看就是现在这个模型能做出来啥了,那大家再去充分的exploit,那也许这个会是一个更的下一步。如果说上来就对着灶月球基地这种终极任务去做,那可能这个做半天他依然收不到梯度,我觉得这个可能是随着做的过程中会不断演变的这么一个事情。【吕鑫燚|具身研习社】
好,刚刚你有一句话我觉得特别有意思,就是现在有的是场景找模型,有的是模型找场景。如果从场景找模型的这个角度来看,目前三位嘉宾有收到过真实的场景的真实非常强烈的需求吗?【范浩强|原理灵机联合创始人】
那从方老师开始,对我们这个对我们因为干就是干居身之前干事业干了很多年了,也被客户追杀了很多很多。他们就说有真实需求,客户他会怀着极大的热情说服你说我这需求很真实。比如我们被带到那个工厂去,说一个工厂4万人,然后他们就带我们看那4万人冲快吃午饭。那场景你就会知道这东西它最终还是得被自动化掉才行,要不然这个世界它是没法运转下去的。就是在这里面的话,我觉得其实现在我们更大的这个状态,还是说跟客户say no。你这事儿我也理解了,就是说很重要。并且那就是说你你你我也明白,你这就是他自己给我们讲的这套逻辑里面,可能这事儿的确适合去做。但是说我们现在的这个技术和交付能力距离能够去把这些客户服务好,那肯定还是差一些的那像在那那像在这种的这个问题里面。【吕鑫燚|具身研习社】
就是我我觉得。【范浩强|原理灵机联合创始人】
只能还是从生产端去考虑。那就是我们自己先力争能把这个模型做的更快更好,这样的话才能去追上这个客户的需求。【吕鑫燚|具身研习社】
好,感谢。【郭俊良|千寻智能预训练负责人】
郭老师我觉得这个需求确实很多,就像刚刚一开始说的,就是我们可能会有非常多。比如说来自上浮,来自工厂的各种各样的需求,然后可能未来会有养老进家庭的一些需求。然后我们现在的这个策略,其实这也是say no。【郭俊良|千寻智能预训练负责人】
就像刚刚说的,我们的主要的主线其实是去focus在技术模型研发上。所以我们会挑一些尽量diverse的一些场景,然后我们会判断这个场景,它让模型去或者说我们在这个场景去deploy,去做一些素材,去做一些后训练,包括强化的然后去deploy。他能最终能让这个数据去做一些回流,然后能去empower我们最终这个基础模型的研究。这个其实是我们最主要判断的一个逻辑,可能因为我们就是需要去focus在主线上。不管是什么样的数据,我们自己采的各种数据也好,还是说我们去合作去做落地得到的回流的数据也好,最终都应该能去让我们的模型越来越强大。让我们比如说明年后年再去做deploy的时候,他的成本也能降下来。【吕鑫燚|具身研习社】
好,感谢。【王志勇|蚂蚁灵波科技系统工程负责人】
王老师答案差不多。我们其实会从两个方面去看场景这个问题。第一个就是说我们会找一个比较难一点的场景。比如说像药房风险这个它链条比较长,品类也比较多,然后挑战会比较大一点。这种我们会自己亲自去下场去做,去把中间的一些,主要是摸一摸中间有什么坑,这个是第一条策略。【王志勇|蚂蚁灵波科技系统工程负责人】
第二条其实我们更多的其实是希望通过生态的做法,我们提供几种模型以及对应的一套工具链。希望跟本体厂商以及这些SV一起去合作。因为他们能够看到更多的比我们看的更多的一些场景,然后也希望通过他们的这个实践的反馈。第一方面给我们的模型有一些反馈,给我们的工具链去反馈,也给我们这个探索性的场景一些反馈。【吕鑫燚|具身研习社】
好,感谢。今天其实我们台下的嘉宾应该是画像都非常全面,然后我们的台上正好又都是模型的。所以我想也是代表我自己来给跟大家请教一个问题,就是场景是2026年居身智能非常。非常关键,甚至可以说是主关键词了。然后各家都在说自己有什么商品什么商品什么商品。我们的刚才的展馆也是非常热闹。如果请各位教我一招,怎么去辨别这个东西他是不是真的进去了。大家会教我什么样的分别的方法呢?【范浩强|原理灵机联合创始人】
这个干过项目的人都知道,就是说项目里最难的事儿叫异常流,就是主流程能成功可能是这个项目10%的工作量,剩下的就是说无穷无尽的就是error fault edge case,就是能把那个东西给就是给包圆了,可能才是绝大部分的这个工作的任务。所以你看别人demo之后,他炒个饭或者加个三明治,就是你想知道这东西是不是真的落地过,你就先问他说。就是在每一个环节里面,如果你这步做错了,你接下来都会咋办,或者你是怎么设计的,如果你发现那哥们儿就一脸憔悴的顶着俩黑眼圈跟你娓娓道来,那大大概率这东西它是真的。如果说是他听了之后表示,这个我也我还没想,那那说明这可能就还是在比较早期的这个阶段。【吕鑫燚|具身研习社】
好,感谢郭老师。【郭俊良|千寻智能预训练负责人】
我觉得其实比较直接,就是因为像wax是一个非常好的一个平台,因为它会让企业去放一些live demo,然后你可以去跟他做一些交互。那我觉得判断他是不是真的,就是你能不能跟他做交互。比如说你是药房的一些分拣或者说怎么着,然后你啪你走到旁边去给他换一种药,然后换一种,可能不同大小什么的object。比如说PKPLACE。比如说你从兜里掏一串钥匙什么的,然后去去跟他做一些交互。对,如果他们放开做交互,并且你跟他做交互,你觉得这个能力还不错,还蛮聪明,那我觉得肯定是make sense的对,其实你看大家愿不愿意去做交互,其实就能判断出来。【吕鑫燚|具身研习社】
好,感谢王老师。【沈宇军|蚂蚁灵波科技首席科学家】
我觉得对。【王志勇|蚂蚁灵波科技系统工程负责人】
demo可能确实刚刚两位老师已经说的很全面了。就是我觉得确实最后的检验还是客户,或者说在真实的场景里面,他是不是能够连续的工作。它中间的异常是怎么处理的这其实我觉得可能到今年下半年或者什么时候可能会看到一些真实的case,但是坦白讲这个路还比较长。但是我觉得大家到线下去真的去看到这个,比如说药房也好,或者是这种快递分拣的也好,大家可能很快就能看到这种比如说长时序的直播,或者是你亲自能看到他的过程中间这些异常的一些处理,以及刻意去改变他带来的一些反馈。这个可能就更加能够比较真实的判断它是demo还是真实的落地。【吕鑫燚|具身研习社】
好,我总结一下,其实就是看交互,看异常流,看实时的反馈。时间关系我们能用最后一个话题来收尾。从模型自己的角度上来看,如果真的或者说以三年为期限,我们要走到实体产业的那一步。那我们现在倒推回来还有几步要走,每一步分别是什么?从峰老师开始。【范浩强|原理灵机联合创始人】
以什么?【吕鑫燚|具身研习社】
以三年为节点。【范浩强|原理灵机联合创始人】
还有我天儿。【吕鑫燚|具身研习社】
总要畅想一下未来。【范浩强|原理灵机联合创始人】
好我试图理出个逻辑来,就是我觉得第一步还是说可能这些具身公司自己先把产品做到稳定可靠,我觉得这是可能是第一步的,现在那可能很大,比如我这机器人自己在这儿自己干个1000小时,他是不是能盯得住?那这可能是很从供应侧需要过的这个第一关。【范浩强|原理灵机联合创始人】
如果第二关我觉得是说对应用方来讲,他可能也需要一个转变思维的这个过程。因为比如说我们之前做那种,比如说工业机械臂落地的时候,那客户其实就是他们之间有要求说你这个东西只要能动,两米之内必须不能有活人,这周围拿个安全围栏先围起来,然后之后就现在比如说想用这种方式去deploy具身的话,那基本就是一个就不可能的这个事情。所以就是说从应用方来讲,可能也需要一个时间去适应和思考。就说之前的那些应用方式里面怎么改才能适应具身未来的发展的方向。对我不是,最可怕的就是他们一些规定可能都非常有道理,这都是需要分类凝聚出来的这么一些实践。那就是说现在想去把这种新的生产力形式发挥出来的话,其实他自己需要一个过程。然后最后就是我觉得三年是有好时间,那第一年估计就POC做过去了,然后第二年可能才敢挑战点小批量,可能到第三年的时候可能才能看到规模化的出货应用等等的这些事件的发生。【吕鑫燚|具身研习社】
好,感谢。郭老师三年确实。【郭俊良|千寻智能预训练负责人】
是一个比较紧的时间线。但是我们其实之前内部做过很多次的讨论,可能我觉得我们觉得三炮三年是有可能去实现的。但是可能我觉得不能光从这个商业化的角度去说,我觉得可能从三个技术方向,一个是data,一个是model,一个是deployed。【郭俊良|千寻智能预训练负责人】
首先就是我们data需要去scale,就是像刚刚一开始说的,我们去scale到某一个,现在谁也不知道是多少。那有说什么一千万小时那肯定是不够的什么。对,就是可能更多的1亿小时什么的这种。然后那可能data scale到某一个量之后,我们去做很多的data fusion、data alignment、retargeting什么一堆玩意儿,然后把这个data处理成可用。【郭俊良|千寻智能预训练负责人】
我们接下来就是model,我们model需要去把这个非常不同源的data。因为这个data未来肯定是大家每个公司采的,每个公司形态都不一样,方案也不一样。那我们需要用model去把他们找到一个unify的方案,去把每一个source的这种data里面的能力去起来。然后最后trend出一个比较powerful model。最后是deploy,deploy那就是刚说的那我们可能通过一些,比如说我们就称之为model。【郭俊良|千寻智能预训练负责人】
假设就像刚刚说的,我们zero shell能有百分之五十六十成功率。那我们去做后训练,去做RL的fine tune,然后包括最后的一些接管什么的。那我们最终可能才能把这个成功率慢慢的去做到2个93个九之类的,能让他可用。对我觉得可能目前最重要的还是在前两点,我觉得甚至可能我们做前两点就需要两年的时间。如果只给三年的话,对。【吕鑫燚|具身研习社】
好,感谢。【王志勇|蚂蚁灵波科技系统工程负责人】
王老师前面两位老师已经说的比较全面了。其实从模型和场景,算法算力就是从这几个要素来讲的话,我们认为模型其实刚刚我们前面的那个首席科学家沈宇军已经说的很清楚了。其实我们就是想从空间感知这样的,从来想的看的更清楚,想的更明白,干的更利索。这个角度的话我理解三年时间还有大量的难题需要解。刚刚说那个模型可能是GPT30个,这大可能大家有不同的意见。但是哪怕现在就是GBC30个,那GB3到3.5,它是因为我们在数字世界的那个数据积累是非常多的那哪怕现在我们能到GPT3的阶段,但是物理世界的这个数据它是非常缺的。所以我理解他的月生意还非常有难度。【王志勇|蚂蚁灵波科技系统工程负责人】
从场景的角度,就是我觉得我们确实可能一年先做POC,在一些场景里面先探索,然后积累一些know how,然后试着去扩展。可能2到3年左右的时间,是不是能在一些真实的场景里面能够替代半个人甚至一个人,这样商家账能算得过来的时候,这个时候才有可能更大范围的去铺开这个生意。好,谢谢。【吕鑫燚|具身研习社】
好,感谢。我们的今天的分享就到此结束了,谢谢各位嘉宾。【吕鑫燚|具身研习社】
好,谢谢吕欣怡,也谢谢我们各位老师。然后这个很让我很让我插一下,原来做具身智能的朋友们对未来的预测都这么谨慎,我们做做模做那个语言模型的,大家不都是三个星期吗?然后我们接下来是我们今天的最后一个原传。然后我们会有请我们去完科技副总裁,屠龙之助的主播装编号老师,和我们的三位嘉宾。第一位是浙大的博导赵俊博,你赶过来了。然后美团longcat team主任研究员顾奇,然后还有是这个LobeHub的创始人徐文彬。好,欢迎大家。【庄明浩|《屠龙之术》播客主播/创始人】
我们要不等大家收拾完再开始。感谢主办方的邀请,也非常感谢主办方的邀请,也非常感谢所有的在场的嘉宾,在这个时间点还留到了最后。我们今天作为最后一场论坛的探讨,我是庄明浩,自己做了一档博客叫屠龙之术,观众爱行业比较多一点。非常感谢主办方的邀请。【庄明浩|《屠龙之术》播客主播/创始人】
我想多说一句,就是为什么我们这场论坛以这样的嘉宾来做这样的构成。我觉得主办方花了非常多的心思来想一这件事情该怎么聊。因为在今天这个时间点,过去的三四年时间前,你们应该在这个大会里面听到过无数的类似的话题的探讨。在这样一个事情的展开下,为什么请这三位嘉宾他们待会儿一会儿会自我介绍,我先简单做一个架构层的介绍。是这样的,就是大家看这个三位的身份,这个赵老师,我们叫赵老师对吧,他现在的挂的身份是浙江大学的博士生导师。你可以认为如果我们只看title的话,它代表着今天这个时间点在学术层面的技术研究的状态。然后顾奇,他现在的挂的title是美团Long Cat team,也就是美团的开源大模型的主任研究员,以及通用agent团队的负责人。如果只看这个title,他可能今天时间点就代表着业界的比较领先的模型厂商们在做的事情。【庄明浩|《屠龙之术》播客主播/创始人】
然后文斌的这个lab hub有人我是他的用户,还有其他人是他的用户,可以方便举个手吗?看没有对吧?那他现在的身份是这样的,你可以认为他今天实验,他是作为今天这个时间点比较领先的开源的应用公司的负责人。所以他们如果我们只给一个title的话,技术模型应用。【庄明浩|《屠龙之术》播客主播/创始人】
但现实的问题在于,很有意思的是赵老师也在做他的模型,以及跟蚂蚁开源在做相关的事情。所以说如果有另外一个身份,赵老师应该坐第二个位置在微信上。然后你看顾其他在longtime team的研究院下面有另外一个身份,他们在负责模型的通用agent也就是说如果再往后做,估计应该坐到第三个位置上。然后文斌其实原来也是大厂的员工,对吧?他其实也参与了很多相关的工作,所以这个身份又有有一定的粘这个粘性,就是它不单纯只代表一个身份。【庄明浩|《屠龙之术》播客主播/创始人】
所以我们今天论坛40分钟大概会有三个问题。一个问题可能相对集中在从技术层飞从技术研发到模型层。第二个问题可能就是从模型层到agent对吧?第三个就是从agent到真正意义上今天时间点的开源应用的生态。然后这三位可能有一个通用的身份,是他们可能都代表着一定的开源的相关的设施的身份。所以我为什么会多聊这个?就是感谢主办方在嘉宾邀请上的很多的小心思。好,先请三位嘉宾做一个真正意义上的自我介绍好吧?【赵俊博|浙江大学计算机学院博士生导师(同时与蚂蚁合作)】
大家好,其实差不多刚才明浩都已经介绍过了,我今天形象不太好,刚才赶上大雨,我这个鞋子里面没问题。对,然后我现在是两个身份,一个是在在学校,在在浙大计算机学院。然后另外一个在蚂蚁这边做我们自己的模型,然后也做一些。【吕鑫燚|具身研习社】
评测工作的对。【顾奇|美国 Long Cat Team 主任研究员、通用Agent团队负责人】
感谢明浩刚才的介绍,我这边比较全,我是顾奇。像刚才明浩说的,我的第一个身份是我现在是在美团这边做这个Long Cat基础模型的一部分的后训练链路研究和Agent R&D的整体的管线搭建。以及部分的模型的A智能能力和生产力的能力的表现,这是通用模型这一侧。然后另外一部分我也在cover美团内部的一个生产力工具,就是类似于美团的open call或者hermes agent,它背后的整体的harness基础设施和整体的整个的专用的能力的提升。所以说我本身之前来美团之前,我也是在一直在做,就是从RScaling然后到RHF,然后到早期有些时候包体跟RL核心包提升的RL,所以说整体上确实很像那个说的对对,可能在算法模型和产品系统上都有一些设计。对。【徐文彬|LobeHub创始人】
大家好,我叫徐文彬,然后现在是在做LobeHub。LobeHub是一个我们大概做了四年的一个开源应用,然后现在的话大概有80K的一个star我是去年出来全职创业做这个项目的,在此之前就是在蚂蚁做体验设计师的。所以今天来,从某种意义上也算是回娘家了。【庄明浩|《屠龙之术》播客主播/创始人】
我感谢三位嘉宾自我介绍,我们正式开始。可能第一个第一个话题可能更多集中在今天这个时间点的模型技术研究上。可能优先先问赵老师对吧?就是从从比如说我们从您学术界的这个身份来看,今天这个时间点我们抛开现在业界已经成为共识的,比如说语言模型,schedule,包括视野模型的事情,就是纯从很前沿的学术研究角度来讲。比如说今天这个学术在关注什么样的进展跟什么样的突破,在模型研发上。【赵俊博|浙江大学计算机学院博士生导师(同时与蚂蚁合作)】
我们这个活动是直播吗?【庄明浩|《屠龙之术》播客主播/创始人】
应该有吧,我不确定有直播的那您可以酌情。【赵俊博|浙江大学计算机学院博士生导师(同时与蚂蚁合作)】
我觉得整体站在高校的立场来说,其实现在这个时间点很难。我觉得难的点是因为包括上周我们在韩国SAML,然后其实可以发现就基本poster没有特别多可以去看的东西。当然就partially是因为这个会议的审稿周期太久了。原先不觉得久,但是现在因为你那个会我记得是春节期间,然后他是一个submission的一个丢。然后就导致的问题是那个时候好像OpenClaw还没有还没有火,可能possibly可能出来了,但是好像没有火。所以就是说整体在那个时间点投稿的论文,在上个星期那个时间点来看,其实就已经相对比较滞后了。是然后就是其一,然后其2,因为你高校最后还是得以一些论文的产出作为整体的衡量标准,那你一篇论文就一定会出现。你做着做着做了一个月发现。【庄明浩|《屠龙之术》播客主播/创始人】
世界变翻过去了。【赵俊博|浙江大学计算机学院博士生导师(同时与蚂蚁合作)】
世界就翻过去了。就是你都说小一点,可能是你有一些悲伤一下就变得特别好或者怎么样。这个时候你只能去把问题,你就因为你这是能死,就是死死扣在哪儿,就是私钥在那儿了。哪怕我今天跟上一代或者上上一代,我也只能跟上一代上上一代去做一些对比或者一些附加实验,这是第二个。然后第三个,我觉得高校现在去做任何跟scaling相关的东西,其实不太被推荐。我个人的感觉是因为其实因为比如我看论文的习惯,如果他最后只汇报这个低于比如说30例的结果。【庄明浩|《屠龙之术》播客主播/创始人】
那其实参考意义就不大了。【赵俊博|浙江大学计算机学院博士生导师(同时与蚂蚁合作)】
其实可能参考意义就没有那么的大。然后你的算法再怎么分析,或者什么那个的,但是你可能真的上了规模之后,你要考虑的事情就很多。你包括你数据层面,包括或者是有数据层面,就是我多扔一些数据是不是问其实问题就不在了,或者说我从infrared角度来说,这个适配难度到底有多少,我的MFU要跌多少降多少。然后这些问题就实际真的上了产线就出现了这些事情。所以其实但是你受限于实际的资源也好,算力也好,所以其实真的想想去做一些更大规模的东西,其实也会比较难。所以就是我说站在高校的立场上来说,我觉得要么就是和公司合作,就像你现在要么对,要么去我觉得去看一些下面的一些事情,要么比如说没有跑出scaling的东西,或者说偏比如说偏一些应用一些,就是通过这个API的方式来做的,或者说去产出一些比较特异化的一些数据,或者索性就不要去做这个做LIF science之类的。我是这么。【庄明浩|《屠龙之术》播客主播/创始人】
想明白问顾行,就是你就像你刚才说的,你现在身份既有模型测的事情,也有偏agent测试的事情。那呃业界的共识可能今天的时间点大家会认为,比如模型级产品对吧?然后大家在尝试所谓的自主净化,来促进整个的流程的演进。从比如说从你们的自身的角度来看,因为你这边一边要去推进模型的上线的能力的提升,同时要做配套的agent这套东西。就是在这个过程中,你觉得比如在过去半年,从你们内部的研发的角度来看,看到什么样的,比如说趋势也好,或者变化也好,或者是遇到什么样的问题也好。【顾奇|美国 Long Cat Team 主任研究员、通用Agent团队负责人】
感谢。首先我先扯一下题外话,首先我也是某一年的蚂蚁校招生。【庄明浩|《屠龙之术》播客主播/创始人】
所以三位都是我的蚂蚁有很多渊源的。本来其实我的问题里是有关于蚂蚁的,然后官方说不需要太强调,那行,那我就把这个去掉了对吧?【顾奇|美国 Long Cat Team 主任研究员、通用Agent团队负责人】
然后其次是我其实有五个,我其实有比较多的,我承接了美团比较多的科研合作,我有五个高校合作,所以我比较清楚整体的老师的情况。包括去年,其实我是去年来的美团,然后我在美团这里其实去年做的表的工作是inference scaling和RS scaling和multi-agent training。然后这里其实有我们今年也中了6篇IC没有,但是去年去开的时候,不是今年上周去开的时候确认你会发现。很多东西大家都不关心了,然后我们自己都没有在研究那个思路去做了。【顾奇|美国 Long Cat Team 主任研究员、通用Agent团队负责人】
这里其实有一个非常大的变化,就是去年开始做的时候,整体感觉大家的关注的是agent的通用性,他能在多少不同的任务下去发挥比较overall的比较好的表现。所以那个时候比较大的关键词是inference scaling,以及我在万级别或者更多的环境下怎么去做很好的训练。在预期是有一这样一个basis,能够span出一个更大的空间,然后通过这个空间hopefully去覆盖一个更陌生的任务。【顾奇|美国 Long Cat Team 主任研究员、通用Agent团队负责人】
这个是整体可能是到今年1月份甚至2月份的主线是open call出来之后,我觉得发生两个变化。第一个是大家发现一些很小的很去,当然这个可能会更早一些。可能去年10月份Claude Code以及相当于开始火之后,大家开始发现中间1到2个特别明确特别重要的任务,值得被更深的去钻研去耕耘。典型的比如cooling是的和一些working场景的一些生产的一个任务。然后第二个是因为OpenClaw这事儿出来,虽然技术上我觉得没有发生跃变,但是大家的focus,大家attention更多,被先牵扯到了这个龙龙踝龙这个事情上。然后你会发现从今年3月份开始,所有人开始讲龙华这种,所以整个重心就nobody的care about什么所谓的environment dealing这个事情了。这个其实有一个比较大的月饼。【顾奇|美国 Long Cat Team 主任研究员、通用Agent团队负责人】
所以从技能角度来说,首先我们在模型能力推演上,现在肯定会去跟focus两个点。一个是把coding和生产力进一步做好做扎实,让大家整个的体验变得更端到端。然后第二个是把任务的头拉长,拉长也是一个scaling的维度,就是所谓的time scaling。然后这里部分首先依赖于可能更好的基建和更好的data的feedback和一些修补。就是针对性的专用性的训练。甚至包括一些特定的外部的很著名的harness之下的一些特定的使用逻辑。【顾奇|美国 Long Cat Team 主任研究员、通用Agent团队负责人】
比如Claude Code的那个什么planning mode,然后一些特定的skills,大家会做一些针对性的training,让他用的更好。然后第二部分针对龙华这种是有两部分,一部分是我有很多的信息管理和loop,第二类是这里也有更多的算法探索,需要去解锁一些训练的逻辑,然后训练不可能变得更可接受。然后从higher角度来说,我觉得它更多是一个call design的状态。其实我现在觉得得到现在这个时间点,它其实已经不太是一个mobile service的状态了。那更多是一个system and service。就是现在所有的公司都在一边做模型,一边做自己最最配套的那个harness。是的,就是model和harness会变成一个system去做更深的code line。【顾奇|美国 Long Cat Team 主任研究员、通用Agent团队负责人】
然后从寂寞角度来说,为什么要做这个事儿?就是因为你的任务要做龙华运动的情况下,你哪怕做训练,做IO训练,你做roll out,当你这个bash里的route最短的那一个也target是一个天级别或者周级别的用户。它本身也非常龙滑的动非常systematical。这个情况下你会expect它需要有很好的一个目标管理,状态评估,以及它过程中的很多的experience。很多经验需要被收集起来,可以复用。【顾奇|美国 Long Cat Team 主任研究员、通用Agent团队负责人】
然后honeys在这里提供的基础能力就是一方面去管理好这些信息,然后另一方面在模型能力还没到的情况下,先做一些脚手架。比如说你脚手架长轨迹,所以他在训练上是有争议的。同时你的模型针对这个harness做的很深的训练之后,它的产品体验上你会看到GBT加codex,然后cloud加这样的效果。对我觉得这个可能是一个这样一个co design共同演化的状态。【庄明浩|《屠龙之术》播客主播/创始人】
那我们就顺延到文明。这就是你刚才讲的是从去年离开真正医生开始在做这个项目。以原来的确实是一个兴趣爱好的事情,变成一个独立的公司的运营。那个时间点是发生了什么?是你看到了什么,还是说遇到什么样的变化,你决定做了这样一个决定。【徐文彬|LobeHub创始人】
其实我觉得是整体的一个时间节点,我觉得是一个很大的一个一个很重要的节点。就是我会发现整个模型能力在那个时间段有了一个很大的一个突破。当时其实决定出来是一方面是我们整体的star数来到了50K的这么一个规模。当时就是我最早开始做,就是没有做任何宣传,然后就自然而然这么增长。然后另外一个很重要的事情就发现其实和我一开始的整一个就会发现社区当中会有非常多的人来一起参与和贡献。就发现现在其实然后他们对于我们其实这个产品希望未来能达到一个也会有他们的一个期待。以及当时在尝试去做商业化的时候,发现也有一些可以有商业化的机会。所以就是综合考虑下来,最后决定就是那个时间点出来,就是创业来做专门来做这个事情。【徐文彬|LobeHub创始人】
此外就是我对于整一个AI的前沿发展也非常感兴趣。然后就是像去年的时候,我们和我和那个NUS的一个实验室也一起做了一篇paper,然后那个叫MCPMark。然后他是讲去年的MCP很火,就是衡量当前那些模型,他们在使用MCP上面他的一个表现。然后我们当时那个benchmark发出来的时候会发现最前沿的模型是O3,然后他在我们那个benchmark上只能拿30份。然后到最近就是可能我们上个月的时候又测了一遍GPT-5.6的话,基本上已经能拿到95分以上。【徐文彬|LobeHub创始人】
然后kimi 2.7,包括K3发的时候也有有测我们这个benchmark。然后K2.7基本上也是到85分85分、80 80分、85分这样的一个程度。他其实就是在做这件事情的时候,我会发现其实现在很多模型能力就是达不到的这种可能做不到。我们想要这个事情,很有可能就是基座模型的能力还没有到这个时间节点。然后可能大家在说的那个loop,然后再说的multi agent,然后scaling,其实很多时候可能是基座模型的能力还没到那个阶段,但是用户其实是有这样的需求。然后我其实会去在推进做的事情就是看怎么样将实际用户需要的需求,能够做出来这样的一些benchmark。能够去引导或者说告诉大家就是model应该往哪个方向去发展,是真的有可能带来很大程度上的一个体验提升的。【徐文彬|LobeHub创始人】
这个其实去年的时候感触非常强,就是我们当时那个MCPMark里面有一个环境是notion。去年的那个时候就是O三这样的模型,就是在一个复杂的notion的template上面让他去改或者加一行。这个事情是成功率是非常低的。但是我们去年定义了这样的一个benchmark,然后包括类似这种模型厂商把这样的一个能力提升上来之后,到现在大家去看那些使用notion或者github或者类似这些软件的时候,它的一个表现就会变得非常的好。这我觉得也是为什么今年work这个概念能够开始兴起的。【徐文彬|LobeHub创始人】
演就是模型能力到了OK大家只要有一套好的harness的封装,然后可能做一些好的产品体验,就能把这件事情做上去。其实我们下一步也会在做个人,比如说longer的benchmark,然后包括可能在产品设计层面UIUX相关的这些benchmark来去。因为你像现在模型,其实你说能做很好的产品设计也做不了。对,就是这些其实说是我们需要能够去定义问题,然后让模型厂商来去把这些能力提升上去,最后能够传导到用户端。大家能够真正的往AGI这个方向去前进理解。【庄明浩|《屠龙之术》播客主播/创始人】
然后你会发现我们虽然第一个趴的问题集中在模型跟技术研发上,但是所有嘉宾的议题全部都推到了agent和honey slope所有的这些事情上。就是似乎在今天这个时间点,在业界在26年的时间点的共识出现了一个边界的模糊。所以我们就进入到第二个议题,真正我们去聊聊这一半年左右的agent的这个事情。我先问还是从赵老师开始,就像刚才文明讲的,其实蒙总来说在过去一段时间你会发现这些agent也好,音乐也好,甚至用户的场景也好,再反过来影响模型的研发。似乎从模型研发的这个角度来讲,可能它已经不像原来纯我们就靠堆算力跟堆参数就可以解决了。开始大家去考虑长城的任务也好,复杂的环境也好。从您在做真正意义上模型研发角度来看,您这半年的这件事情上的感受大概是什么样?【赵俊博|浙江大学计算机学院博士生导师(同时与蚂蚁合作)】
我这半年其实跟他俩有一个感受是类似的,就是所有的长城任务是一场大考。对我觉得你最后RL揉出来,你柔到64K是个多少分。然后你到比如说128到256,你就把120线圈打开之后,你就到底是一个什么什么情况。【赵俊博|浙江大学计算机学院博士生导师(同时与蚂蚁合作)】
其实长城的这种轨迹的数据也好,或者说他的评测也好,或者说他的整体的training也好,其实我觉得这是一个大口。就这个模型能不能做操,你RO能不能揉起来?然后我觉得确实如顾其莳所说,其实现在一个整体就是说你的Harris和你的模型是处在一个并行在在走的这么一个状态。因为就比如说你比较痛苦的事情,比如说我一直按照Claude Code去做我的所有训练。我的这个SFT的数据是经过Claude Code,我的RL也是用Claude Code作为基础的教育家再去做,包括我的评测。但问题就是Claude Code是来自于s profit,然后他那天给你更新一下子,或者说他对吧?【赵俊博|浙江大学计算机学院博士生导师(同时与蚂蚁合作)】
这以后面向,因为你现在的很多,比如说跑一天的可能是ok的。但是比如说跑到一个星期的code,code一定会升级,拿到那几层memory的整个的压缩等等,就这些逻辑多级的拆分,然后他如果再升级的话怎么办?你的RL不认识他,你的数据之前没有见过他,所以其实这些都会都会形成一个问题。所以我觉得以目前现在这个趋势来看,这个整体就是这个轨迹会变得越来越长时间,也会拉的越来越长。【赵俊博|浙江大学计算机学院博士生导师(同时与蚂蚁合作)】
其实给评测也会带来很大的问题。我再跑一个礼拜咋评,我也不知道怎么评。然后现在像之前大家讲的很多的那些个什么所谓的PRM,就这个process这些reward这些分。我觉得现在目前来看,最后就是大刀之间根本没这个东西,也不需要,我也不知道需不需要,反正目前我这边是是不太需要。然后对,反正让我看的话,反正就会时间越来越久,归期越来越长。【庄明浩|《屠龙之术》播客主播/创始人】
那那那那那就是他是一个确实是一个对所有人一样的差不多的考题,但所有人都要去回答。你们作为萌新厂商,尤其是在追最前沿的模型厂商,如果你们同样也做通用位置,那你们内部怎么去评判这件事情的?比如阶段性的里程碑目标,或者比如说跟今天这个时间点是不是最领先的领先者之间差异化或者B对比的这个事情我们。【顾奇|美国 Long Cat Team 主任研究员、通用Agent团队负责人】
分两个部分去说,其实现在大家基本上focus健康的挑两类任务。一类是call in生产力,这个其实很明确,这个很明确就是说我去不断的去动态的去适应现在最新的框架。然后它的长城能力其实预期是没有那么高的。就是看我现在的框架能做到什么程度,我现在的模型能做到什么程度,我把很多的feedback,很多的体验都优化到一个极好的状态。它是一个catch up的逻辑,它的逻辑就是我去最强的模型,然后到一个使用同样的使用体验,它是强数据驱动的,这是一部分,当然这里是比较基础的部分。然后另一部分是大家现在在同一个起跑线上在做的,就是这个龙头,董目前应该还没有特别好的范式,真的能说去处理ultimate loan或者unlimited loan这样的一个东西。所以大家还在一个偏偏探索的状态。【顾奇|美国 Long Cat Team 主任研究员、通用Agent团队负责人】
然后这里其实包括像刚才赵老师说的,就是honest这里我们为什么要自己做?除了赵老师说的点之外,还有一个就是我觉得现在你的harness怎么设计,里面侧重哪些点里面你给模型做这个脚手架,就是honest本质上对jim来说,它是三个职能。第一个是刚才说可能他定义模型怎么跟环境交互,能跟什么样的环境交互,能收哪些信息,能发哪些信息。然后第二个是他能够以多高的信息密度,多好的使用便捷程度去很好的使用。【顾奇|美国 Long Cat Team 主任研究员、通用Agent团队负责人】
不管是外部给他的information和经验,或者skill或者whatever一些东西,还是模型自己在experience在exploration过程中找到了这样的一些经验也好,信息也好,他怎么样去统一去管理,他去把它糅合到下一次做执行过程中,这个是honest需要去做的。而且你的任务做的越长,一定会需要有这个东西,不可能全都塞到上下文里,或者几乎很难全都塞到上下文里。对。【顾奇|美国 Long Cat Team 主任研究员、通用Agent团队负责人】
然后第三个是模型的任务,如果是去做无限长的任务,他一定就是你怎么让他做无线能的任务。这有一些reward的设计,有一些可能什么PRM或者criticism的设计也可能没有,也有可能需要中间有一些一些所谓的我做目标评估,做状态评估,做不断的跟最后目标的align我不偏离太远,我不太发散。这样的设计实际上本身也是模型design那一部分,就模型的design harness design会高度耦合。所以说你用cloud的话,你会感觉是不够的。对他对你不透明。是的,他对你不透明,你不知道他加强了哪些,削弱了哪些,他跟你的设计不一定有line。然后另外一个点是就是你用SOPIC的话,它有可能在一些你觉得你用cloud,你会觉得他在一些你觉得不必要加强的教授加强做过多的加强。是的,这个也会定成让对任务起到代偿,然后他会你的对你的训练起到一些不好的影响。【顾奇|美国 Long Cat Team 主任研究员、通用Agent团队负责人】
所以说我很好的去掌控模型,应该在哪些地方有脚手架?应该在哪些地方没有脚手架?这个对寂寞来说很重要,是对,所以大家必须得有这样的东西。然后第二个点是这个本身作为第二个大的点,就是这个东西本身作为跟模型捆绑在一起的产物,就是现在其实都是asian net service,大家不会去看你是模型更强一点,是honestly做的太好了,大家都会去看。比如说你的code加上你的GPT,或者说你的CPM的gas说被加上一个cloud,它整体的端到端任务完成,交付能力怎么样,它会整体上这个东西,所以说你在这里能够很好的co design做出一些差异化的体验或者特色,对整体的使用功能、使用能力、问题解决能力和交付状态也会起到很好的影响。对。【庄明浩|《屠龙之术》播客主播/创始人】
那正好顺连到脚手架一方,对吧?那这个问题可能在过去一段时间,也有无数的厂商都问过。我们作为一个纯应用开发者,我们其实只有基本上完全不碰模型。但是今天你会发现这个顺延的趋势,模型厂商跟agent之间的耦合性越来越强。作为我们这个独立的一些厂商,你会通用的问题就是到底是模型会吃掉更多的脚手架的能力,还是说本身来讲,在不断的过程中,我们作为agent也好,脚手架也好。他持续的会有他自己的擅长跟独特的能力来去获取用户也好,得到关注也好,或者怎么样。【庄明浩|《屠龙之术》播客主播/创始人】
就这个的议题从你的体感,因为你可能是最一线在感受这个事情。这过去一段时间这个议题也不断的在经历,一方面极度乐观,一方面有极度悲观对吧?这个每天都在蹦对吧?那你怎么看这个事情的这个眼睛的变化?【徐文彬|LobeHub创始人】
其实我觉得模型厂商一定会去做自己的harness的。然后这个其实从athletic在去年发3.7的时候就已经被证实了。当时他们内部在训3.7的时候用的就是Claude Code销售价,然后就是呃然后后面这个范式被证明之后,其实基本上大家都会开始做做这样的一个形式。【徐文彬|LobeHub创始人】
其实从我们现在在做LobeHub这个harness的这个角度来看,其实有一个非常关键的一个差异性是在于你的这个harness是面向于什么样的受众?比如说像大家最近或者说过去半年或者一年都在侧重于coding这个场景。那其实大家所有用的harness的设计都是围绕coding这个场景去提供的。但这里其实在普通用户来使用的情况下,其纯coding的这个形式,哪怕你是用coding的这个内核去驱动,在很多交互上面的体验还是不太够的。【徐文彬|LobeHub创始人】
比如说写一篇文档,就对普通用户来说,就是你生成一个mark down,可能真的是不太能够看的那最好是我能不能直接就绑一个纯的在线可以编辑的文档,然后甚至可以分享出去的。然后可能就是我这个长城任务如果是像CC或者像code SM去一个指令里面去一个go放出去,你中间没办法去管理。那那能不能像linear那样,你拆很多的子的issue,或者你拆很多可以无限级连的task。每一个agent可以把任务分配到不同的那个task下,然后去甚至不同的task用不同的模型就是plan。然后这几个环节其实有非常多可以去做和优化的这么一个地方。【徐文彬|LobeHub创始人】
从我的一个角度来看,其实我始终是关注用户需要什么,就是用户体验上面可能最最需要的一个东西,然后来去做这么一个设计和一个出发点。所以像我们的这套harness,其实它不是一个面向coding的agent,而是一套harness。它更多的是一个偏通用的,然后用户可以插装,可以去做很多自定义的这一个harness,并且他也是开源的。所以像赵老师那个问题就是如果用我们的这套harness,就是他去肉你版本锁一下,他就不会去有任何变更。然后我们其实内部也非常会去看,benchmark这个是。事情像就是因为在这里其实有很多harness上面,大家会觉得这个上下文的设计现在不是一个科学,它是个art。【庄明浩|《屠龙之术》播客主播/创始人】
然后这个其实对。【徐文彬|LobeHub创始人】
他在最近一段时间写过一篇培一篇blog,他们在设计非常多的context的时候,比如说你的记忆过期快过期了,或者说在七天前的,他会插一个system reminder说你这个记忆是七天前的,你可能会是过时了的。你要注意是不是会有这样的问题。然后比如to do list他在跑的过程当中,可能在第五轮或者第十轮插一个提示,你当前focus的是在什么地方。【徐文彬|LobeHub创始人】
这些设计其实都是围绕之前Claude Code,它就是cloud系列的模型能力不够强。然后它针对这个场景专门去做的这么一个东西。但是像我们比如支持几乎市面上所有的模型,然后我们这套harness怎么能够去针对这些模型去做适配。其实一个非常关键的抓手就是不同的benchmark像我们就会去跑像terminal bench,然后那个叫什么来着?就是brother camp这样的一些benchmark。然后像我们最近跑的一次在tomato bench 2.1上面,我们的harness搭配GPT-5.6已经是超过CC加那个OPS4.8。【徐文彬|LobeHub创始人】
所以其实这是其实是会去我们从做harness层面关注的这个东西。假设模型不一样的情况下面,我们怎么样子去提供足够好的这些工具的设计,上下文的设计,以及用户场景下面他需要的一些更好的交互的一些东西。然后最后就是一个我觉得是一个偏系统设计的这么一个状态。【庄明浩|《屠龙之术》播客主播/创始人】
那就顺延这个问题。大家知道在26年的时候,你明显感觉我们直销在国内的话,基本上头部的模型厂商跟互联网大厂已经进入到了一个新的战役里,就是关于认真的这场战役,腾讯有work body?有code body,有q cloud,还有Mavis?然后自己也有tree,有这个扣子,然后可能还有海外一个版本,然后飞书也在推他的一人?阿里有coder,有muller run,有悟空,虽然现在都合在一起了?然后这个多包的最新专业版其实也在推agent的事情。然后本身来讲,我们从原来的chat ball战场真正意义上开始打这场战役。你就是作为原来就在这个战场里的从业者,你怎么看国内的这些厂商在今年突然间的在这个事情上这么用力的来做这些事情。【徐文彬|LobeHub创始人】
我自己的个人感受是我觉得OpenClaw带,它就有点像差的GBT。【庄明浩|《屠龙之术》播客主播/创始人】
GBT3点50个点燃了一下。【徐文彬|LobeHub创始人】
点燃了对,点燃所有人对这个事情的激情。然后此外就是SOPIC,他用Claude Code证明了coding加企业的这种路径,其实能带来非常大的一个商业化的收入。我觉得这个可能是这个路子被跑通了,然后大家就都会来往这个方向去做。然后这我自己的个人感受其实就是我感觉agent本质上它是一个劳动力或者是它它更多的是一个企业,或者说大家现在说的生产资料。生产资料这件事情其实往往会优先在在整个生产力革命当中,往往优先会在企业端发生。所以我觉得大家一方面是有发现商业化有很大的一个机会,一方面就OpenClaw,就是把大家的认知都已经迭代到这个阶段了。那我觉得大厂就是投入来做,其实挺挺顺其自然,或者说很顺理成章的这么一个状态。【庄明浩|《屠龙之术》播客主播/创始人】
那就问问吴绮,你们有推你们自己的类似的产品吗?【顾奇|美国 Long Cat Team 主任研究员、通用Agent团队负责人】
对我觉得open close其实是一个很有意思的事情事件。其实从技术人的视角来看。【庄明浩|《屠龙之术》播客主播/创始人】
其实没什么是吧?【顾奇|美国 Long Cat Team 主任研究员、通用Agent团队负责人】
其实并没有感觉OpenClaw有一些什么特别大的技术创新,或者说有那种商户海啸级别的这种合并的感觉。河南爆炸了,你不会有这种感觉对吧?就是但是他确实因为把抹级的他提供了很好的展示层,很好的把一部分的模型能力能做到的事情包装给了一些更广泛的,更人群体量的人群,然后引爆了一轮新的关注度和话题,然后把大家的attention集中了过来。Attention集中过来之后,就这个领域已经负极了太多的聪明人。所以大家一起做某个事情的时候,会快速推动某一个方向的快速进展,我觉得是这样一个驱动力。【顾奇|美国 Long Cat Team 主任研究员、通用Agent团队负责人】
然后从这个角度上来说,大厂看到这里高度的经济价值和回报和收益之后,就确实开始也都在推给整个内部的什么q cloud。阿里也有阿里的cloud,然后我们有自己的catalogue,然后我们甚至还有cat cloud各种版本,什么cat desk,什么cat desk pro,然后一些什么乱七八糟的别东西。对,然后都在做一些这样的这样这样的基建。然后大家再试着从coding去延展出去,延展到大家日常的办公工作work对work。然后再延展到可能更多的更广更广谱的一个白领的工作范畴。对我觉得可能是这样一个沿途的逻辑。【顾奇|美国 Long Cat Team 主任研究员、通用Agent团队负责人】
然后第二个点时间,大家现在大家在龙怀洞的时候,就是龙踝龙其实是一个很难构建。我刚2两个2位老师其实都提到benchmark,其实龙华用的benchmark是很难构建的玩意儿。对,其实现在所有的大家能看到能用的龙海龙benchmark基本都在coding agent上,是都是龙怀龙and fan的coding task?所以说coding其实是一个很适合超龙出来的一种扩展的一个东西。所以现在很多前沿的研究也聚焦在这里。然后这个会跟harness的整体的结合也会很也会也会比较紧密,他一定是说他也会去进一步去推动harness的发展。【顾奇|美国 Long Cat Team 主任研究员、通用Agent团队负责人】
然后第三个点是coding。其实作为一个表达载体,它本身具备单不可校验性,而且它本身的训练语料至少是比自然语言逻辑性要更强的。是的,天然就强。对,所以在做longtime task的时候,用更多的coding作为表达在一起,一定程度上有可能能够延长模型执行任务的这样一个区间和周期。所以这个是我觉得大家现在比较focus coding的一个原因。【庄明浩|《屠龙之术》播客主播/创始人】
对然后我做一个现场想干啥,就是现场咱们在座的现在的嘉宾,真正意义上你们在你们的电脑里或者手机里,真正意义上装过已经在使用的各种各样的,无论是谁家的agent的产品。【吕鑫燚|具身研习社】
方便举一下手吗?【庄明浩|《屠龙之术》播客主播/创始人】
这个比例比我想的要高的很多,当然可能跟在场的观众的人群覆盖相关,对吧?然后我再举个为什么问这个问题,因为是这样的,就是OpenClaw火应该是春节火的。然后春节火了之后,在所有的模型厂商头上都推了各自组织的cloud,然后到这一轮的所谓的各种各样的work,然后经历了可能就是半年的时间。就半年的时间之后,在中国的全权的这个范围受众力,大家可以去感受一下。【庄明浩|《屠龙之术》播客主播/创始人】
或者说如果大家有兴趣晚上回家可以问问你自己的agent跟AI大家可以感受一下,觉得中国有多少的用户在25年26年7月份这个时间点已经在用agent产品,而不是单纯跟豆包聊聊天。大家可以感受一下。这个人群应该是一个比如拍脑袋的意向。我觉得在三个月之前,就是这一轮我可没推之前,可能这个人群是在百万这个量级。几百万我不知道。今天可能比如到了千万量级是有可能,但是几千万是大几千万还是小几千万我也不知道。【庄明浩|《屠龙之术》播客主播/创始人】
但是这里出现了一个问题,这个问题是什么呢?在这个新的战役的战场里,似乎看上去目前有一些厂商在推自己的这个产品,定义类似太子的这个身份对吧?然后这个号对外号称已经是一个单产品,已经可以是千万级以上的DA我觉得这个数字本身可能会有比较大的问题,这个我不展开,大家有兴趣可以回去跟自己的agent去对个对话,对吧?然后我们这个实验差不多我们最后一个问题可以稍微发散一点。比如说现在是2526年7月份,比如到26年底。各位嘉宾所在的团队也好,所在做的事情也好,你期望我们能够做到什么样的里程碑也好,或者变化也好,或者期待看到什么样的新的东西出现也好,可以做一个稍微,因为刚才上一场是延展三年,对吧?在我们这个行业现在三个月都我觉得都是一个挺挺长的事情了。那我们就稍微推一点,就推到比如年底大家期待看到什么样的东西,自己团队也好,行业也好都可以。【吕鑫燚|具身研习社】
26年底我在我。【赵俊博|浙江大学计算机学院博士生导师(同时与蚂蚁合作)】
这儿就是那个模型能跑,我觉得俩礼拜,两个地方不要停。然后这个常驻任务。【庄明浩|《屠龙之术》播客主播/创始人】
现在是多少?【赵俊博|浙江大学计算机学院博士生导师(同时与蚂蚁合作)】
不能说好吧。【顾奇|美国 Long Cat Team 主任研究员、通用Agent团队负责人】
我觉得差不多,我觉得今年的focus还是在long holiday on现在开始还是也就是开始半年。然后mysql stone我觉得在我这有两个。然后第一个可能是也是跟沈老师,也是跟那个赵老师差不多,基本就是说我的模型能够连续执行一个多长的任务,我会预期它能够达到周级别。然后呃当然可能在一些特定开始的辅助下。第二个是如果说我和多模态进来,我会希望模型能够在一个多模态的比较复杂的场景下做到小时级别。那ok我没有。【徐文彬|LobeHub创始人】
我这边其实比较希望的有两方面,一方面是对模型层面的一个期待,也刚刚两位老师有提到Long Horizon,我这边可以更具体一点的一个一个期待是它能够实现比较完整的自我验证。我会发现其实在到agent这个阶段,就是他通过做比如说十步二十步。这种就是完成一个任务之后,其实问题接下来就交给了用户。【吕鑫燚|具身研习社】
你来评判吧,是不是?【徐文彬|LobeHub创始人】
你来看看吧,这个做的对不对?但是其实就是如果一个好的一个状态,就是他应该自己验证出来这个东西对或者不对之后,他才应该交给用户。这个时候用户只需要做最终的一个验收。【徐文彬|LobeHub创始人】
但我现在觉得就是可能现在Fable 5,它有一点这样的一个迹象,就是它会在比如说做口鼎任务之后,比如说偏后端或者前端这样的页面,他自己会去把那个跑一下,就是截图或者做一下用户的这种操作。但这个也比较少,就是他有这个迹象了。但其他大部分的模型都还缺少这样子的这种能力。但我觉得如果说,这个东西是我觉得在long horizon task当中一个非常关键的一个节点。当你能够因为plan或者说reasoning已经基本ready了,那ok我可以把任务拆成比如说十步或者5 20步大的环节。我如果模型能够很准确的自我验证出来,某个环节真的做好了。那ok那他真的有机会去跑十几二十个小时,甚至几天,甚至十几天能够继续往下去走。然后我对我们自己产品的一个期待是在未来,就是可能三个月或者六个月之内有这样的模型产出了之后,我们的产品能够给到用户一个很好的交互,可以去完成这样子的,然后跟他是个管理。【徐文彬|LobeHub创始人】
因为这其实就意味着就是一个可能,比如说一个非常大的项目,可能比如你原来人要做一个月的项目,现在你真的可以有一种很好的交互方式,让用户能够让agent在那边跑可能很久很久的一个时间,让而而且你会放心愿意让他去跑这么久。这个我觉得其实就是agent其实从Claude Code开始,就是你开始让他写一点代码,在可能变成写一个需求,再开始做一个很大的项目。信任是这样子一点点积累起来的那同样的就是做这种logo on the task,我觉得可能从用户感知的角度,也需要就是从一个任务变成一个大任务,再变成一个巨长城的这种任务的一点点的一个往前走的一个阶段。所以我希望我们自己的产品能够去承载这样子的一个能力。然后能让用户从一个小任务开始,能够开始做到更大的这样的一个任务。【庄明浩|《屠龙之术》播客主播/创始人】
对OK感谢。然后这个论坛的最后给大家一个小的礼物是这样的。就是如果你们听到了整个下午论坛的环节,包括我们谈论的很多的议题,开源模型进展agent harness,然后整个开源生态的变化,可能听完感受不是很深,我推荐给大家去看一份报告。这份报告可能非常详细的整理了过去半年左右时间,整个开源生态发生了什么样的变化。包括非常的详实数据图表可视化的状态做的非常的好。【庄明浩|《屠龙之术》播客主播/创始人】
这份报告在哪儿呢?大家可以打开自己的微信,关注我的公众号叫蚂蚁开源。大家把关注公众号之后往下翻翻到我看一下5月27号的推送,这篇文章叫AI2026。当黑客松式的狂欢冷却下来,我们的我非常推荐大家有时间可以去看一下这份报告以及相关的图表。可能对于大家理解今天这个时间点,不仅是开源,可能整个AI行业的发展有非常好的帮助。好,再次感谢大家,谢谢。【吕鑫燚|具身研习社】
谢谢明浩老师,猝不及防插了一个广告,就是这么硬的广告,自己都说不出口。谢谢配合,配合太好了,感谢明浩老师,然后感谢刚才的各位嘉宾俊博、顾琪等给我们带来的精彩的讨论。今天大家可能已经非常累了,然后外面配合着外面的电视雷鸣,我们也完成了做了一个很充实的一个下午。再次感谢大家来参加我们的这个论坛。好,谢谢大家。




