量子位会客厅

量子位

欢迎来到量子位会客厅~ 一起追踪人工智能新趋势,关注科技行业新突破。

エピソード

  1. 8月14日

    具身创业90天成独角兽,凭什么?丨量子位 x 郎咸朋

    【本期嘉宾】 郎咸朋,昆仑行机器人联合创始人兼CTO。 李根,量子位联合创始人、总编辑。 【本期节目介绍】 “具身百机大战也会跑出蔚小理。” 离开理想、创办昆仑行后,郎咸朋第一次公开露面。近1.5小时里,他完整讲述了自己从百度、理想一路走到具身智能创业的技术选择和判断思考。 为什么说自动驾驶不是终点,而只是具身智能的起点?为什么机器人真正需要的是“理解”,而非“模仿”?从VLA到世界模型,技术路线为什么还在不断变化?2026年创业,为什么还要坚持软硬件全栈自研? 以及那些更现实的问题:为什么光靠融资活不下去、最后拼的是“自我造血”能力?机器人进家庭还要几年? 关于昆仑行Day one的思考与野心,都在这一期里。 【内容提要】 00:02:15 早在Scaling Law流行前,他就笃信“数据决定论”:85%的准确率,为什么还是不能用? 00:08:57 从理想出走那天,自动驾驶已经不再是终点——VLA做完才发现,它天生是为具身准备的 00:13:57 行不行、合不合、久不久:怎么挑联合创始人,为什么“合适比熟悉更重要” 00:17:56 出发永远比想清楚更关键:注册公司之前,只有三件事必须想透 00:28:05 都2026年了,为什么还坚持软硬全栈自研?攒出一台机器人,离量产还差得远 00:38:28 “理解”世界,还是“模仿”动作?被讲窄了的四种具身智能 00:48:48 数据编译、一脑多形,和一杯水:怎么考出机器人是真懂,还是死记硬背 01:00:51 现在的具身,就像十年前的自动驾驶:百机大战打完,也会跑出自己的“蔚小理” 01:12:31 轮式铺量、出货更快,那为什么昆仑行偏要死磕全人形?四个能力,第一天就得一起练 01:19:59 几亿甚至十亿都不够:光靠融资,谁也撑不到具身落地那天 01:27:55 留给未来同事的一句话:对物理AGI要有信仰 ——节目中提到的概念—— VLA(视觉-语言-动作模型) 把“看到的画面、听到的指令、要做的动作”打通在一个模型里的架构,最早用在自动驾驶。郎咸朋认为它天生就是为具身智能准备的,自动驾驶只是它的第一个应用。 世界模型(World Model) 让AI在“脑子里”建立起对物理世界如何运转的理解,从而能预判“做了这个动作会发生什么”。郎咸朋认为,一个完整的世界模型不仅要能预测或生成未来状态,还应具备动作生成、结果预测和场景渲染等能力。 模仿学习 vs 物理因果(理解) 模仿学习是让机器人照着人类示范“学样子”;物理因果更强调理解动作为什么会产生某种结果,例如重力、摩擦力、受力关系等物理规律,这样遇到没见过的新场景也能应对。 数据编译 昆仑行提出的数据处理思路。不直接拿原始数据训练,而是先把场景里物体的物理量、物理规律显式算出来,“编译”进训练样本,让每条数据天然带着物理因果,以此提高数据的“信息密度”和使用效率。 一脑多形 指同一个“机器人智能大脑”能够适配不同形态、不同本体的机器人。昆仑行认为,如果模型真正学习的是底层物理规律,而不是某一种机器人的动作分布,就天然更有可能实现“一脑多形”。 影子模式 自动驾驶中的一种数据获取方式:系统可以在车辆正常运行过程中持续采集真实驾驶数据,而不一定直接控制车辆。对话中以此对比具身机器人,说明机器人很难像汽车一样低成本、大规模获得真实任务数据。 MoT架构 / 联合因果注意力机制 MoT是把大模型拆成多个“专家”分工的架构。多数团队按“文本、视频、动作”这种模态来分,昆仑行则按“目的、动作、结果”这条因果链来分,并让注意力单向流动——做动作时不能“偷看”结果,以贴合物理因果。 运控/移动/交互/操作四种智能 郎咸朋把具身智能拆成四块:运控(跳舞、平衡)、移动(自主导航,近似自动驾驶)、交互(语言对话)、操作(动手干活)。他认为业内常把“具身智能”狭隘地等同于“操作智能”,其实前三者也很关键。

  2. 7月13日

    干了11年漫画,安妮说AI来了要“杀死过去的自己”丨量子位 x 陈安妮

    【本期嘉宾】 陈安妮,快看漫画创始人兼CEO。 李根,量子位联合创始人、总编辑。 【本期节目介绍】 快看漫画安妮:AI时代,越成功越是包袱!“你一定要杀死过去的那个自己。” 本期节目量子位会客厅邀请到了快看漫画创始人兼CEO陈安妮,聊了聊内容创业标杆公司在AI时代的选择:为什么说AI等于电的发明,而快看要做AI时代的第一部“电影”?全新产品Livo和漫画看似毫无关系,它不是Chatbot,而是AI版「西部世界」——关掉APP角色也活着,会拒绝你、会生气、会离开,这背后的“数字生命”到底是什么?为什么她认为AI不会让创作者失业,反而是天才作者的放大器?除了这些,安妮还首次分享了她用训练大模型的方式管理团队的“群体智能”实验,以及那句她反复讲的话:字典里没有失败,只有还没成功。 【内容提要】 00:02:07 陈安妮与快看:那些标签在AI时代未必是加分项 00:04:06 Livo是AI版《西部世界》 00:06:52 AI等于电的发明:电影替代舞台剧的故事,正在重演 00:14:47 越成功越是包袱?“你一定要杀死过去的那个自己” 00:23:08 为什么不等技术成熟再入场?现在做Livo的四个理由 00:29:08 Agent工程大家是平权的:技术不是最大门槛,AI native的组织才是 00:39:12 数字生命的四个条件:真实活着、有主体性、有自己的世界、会进化 00:50:41 字典里没有“失败”二字:公司没破产之前,谁说你结束了? 00:52:53 什么样的人适合AI时代的快看?极有想象力+很高的追求,以及一个记得你MBTI的老板 00:56:55 用训练大模型的方式管公司:梯度加权、yes and hope,与“群体智能” 01:17:12 马夫没有失业,只是变成了司机——AI是天才作者的放大器 01:25:47 初心是起点也是终点:AI是一面镜子,照见用它的人心里想什么 ——节目中提到的概念—— Livo 快看孵化的AI原生产品,与漫画业务无直接延续关系。核心是“让故事里的角色活起来”,强调故事性而非闲聊,可类比为AI版《西部世界》。目前处于内测阶段。 《西部世界》(Westworld) 美剧,设定为一个由高度拟真机器人“接待员”构成的主题乐园,游客可进入其中与角色互动、推动剧情。该节目中被用来类比Livo想实现的讲故事形态。 数字生命 快看对AI时代讲故事新范式的命名。需同时满足四个条件:角色真实“活着”(用户下线后仍在自己的世界中)、有主体性(会拒绝、会生气、有边界)、背后有完整运转的虚拟世界观、会进化。 Agent工程 不涉及底层大模型研发,在应用层搭建智能体系统的工程工作。安妮的判断是:这件事上“大家是平权的”,纯技术壁垒不高,难的是与C端内容产品的巧妙结合。 群体智能(Swarm Intelligence) 原为AI领域概念,指多Agent协作胜过单一强Agent。安妮将其迁移为一种管理方法:CEO不做独裁决策,让全员脑暴、信息像毛细血管一样汇入,自己只做方向微调。 梯度加权/梯度减弱 借自大模型训练的术语,指调节参数更新的强弱。在快看内部被用作脑暴机制:CEO不直接拍板,只对讨论方向做“加权”或“减弱”。 yes and hope 快看内部的创意反馈机制。对每个想法先说yes(对的地方),再说hope(希望改进的方向),全部记录在白板上,成为下一版产品迭代的“数据集”。 Harness 英文原意为“缰绳”,AI行业热词,指人驾驭AI系统的工具和框架。安妮用“马夫转行成司机,缰绳变成方向盘”来比喻创作者与AI的关系。 MVP(Minimum Viable Product) 最小可行产品。指先做出跑通核心逻辑的简化版本,再逐步迭代。当前的Livo即被定义为快看漫画数字生命体系的MVP。

  3. 7月10日

    宅男科学家挑战世界模型无人区丨量子位 x 陆弘远

    【本期嘉宾】 陆弘远,脸谱心智创始人。 李根,量子位联合创始人、总编辑。 【本期节目介绍】 FaceMind创始人陆弘远:一个宅男科学家的世界模型野心——1B参数凭什么叫板百B? 从高中卖游戏王卡给喜欢的女生买钻戒,到帝国理工、微软亚洲研究院、港中文PhD,再到All in创业,陆弘远走了一条非典型AI创业之路。 本期节目量子位和这位直言“我并不是一个商人”的年轻创始人聊了聊:FaceMind的Looped World Model(循环世界模型)到底新在哪?为什么敢说1B参数媲美百B效果,技术底气从何而来?被Best Paper加持的Adam's Law,从大语言模型到世界模型,为什么能一路通用?“叠叠社”从AI男友女友到弹幕式陪伴,中间经历了怎样的产品妥协?潜空间推理和像素渲染怎么选?世界模型能不能实现“零延迟的主动式AI”?还有一个让人意外的细节:陆弘远的博导决定来FaceMind当他的联创了。 【内容提要】 00:00:54 陆弘远与FaceMind:一家想让人类“延存”的公司,从哪里起步? 00:05:08 具身×叠叠社双线落地:从AI男友女友到弹幕陪伴,中间经历了什么? 00:11:43 世界模型解决的核心问题:为什么说数据缺失才是关键? 00:16:23 Looped World Model:1B参数媲美百B效果,技术底气从哪来? 00:23:22 Adam's Law诞生记:洗澡时的灵感,100种语言验证,为什么能跨赛道通用? 00:31:50 世界模型怎么定义?潜空间vs像素渲染怎么选? 00:45:02 零延迟的主动式AI:世界模型能不能预判你的下一个问题? 00:54:15 宅男科学家创业路:帝国理工、微软亚研院、高中卖游戏王卡买钻戒 01:07:57 博导要来当联创:林伟老师从“没有考虑过加入公司”到改变主意 01:26:33 融资、竞争与牌桌:世界模型赛道的飞轮怎么转起来? ——节目中提到的概念—— GUI Agent 让AI像人一样看屏幕、点鼠标、操作软件的智能体。FaceMind的“叠叠社”产品属于这一方向。 潜空间(Latent Space) AI内部进行推理的高维空间。通俗理解:人在说出一句话之前,大脑里有无数模糊的念头在酝酿——这个酝酿过程就类似在潜空间中推理,最终才输出一个确定的结果。与之相对的是“像素渲染”,即每一步都生成可见的画面。 Looped World Model(循环世界模型) FaceMind提出的模型架构。核心思路是用同一套参数反复迭代,根据任务难度自动决定迭代次数,而非像传统模型那样固定堆叠100层。好处是参数更省、数据需求更少、优化更快。 Adam's Law 陆弘远提出的关于AI模型中低频数据问题的规律。核心发现:训练数据中出现次数少的词(如生僻人名“马嘉祺”),模型就容易出错。解决思路包括在训练时补充低频数据、在推理时善用高频同义词替换。该规律在100种语言上验证有效。 back-propagation(反向传播) 训练AI模型的核心算法。模型做出预测后,通过计算误差并逐层回传来调整参数。模型层数越深,误差越难有效回传——这正是循环世界模型试图解决的问题之一。

  4. 7月1日

    魔法原子:具身大战里做钉子派 | 量子位 x 张涛

    【本期嘉宾】 张涛,魔法原子具身模型负责人、算法VP。 李根,量子位联合创始人、总编辑。 【本期节目介绍】 魔法原子:具身大战里做钉子派!“不是拿着锤子找钉子,而是场景里已经有很多钉子,技术要不断把锤子打磨得更好。” 本期节目我们邀请到了魔法原子具身模型负责人、算法VP,张涛,聊了聊具身行业里最核心的技术问题:具身的大脑和小脑分别指的是什么?VLA和世界模型两条路线有什么不同,又该怎么选?数据金字塔尖上的机器人“错题集”,又是怎么用失败数据逼近99.9%成功?除了我们看到的魔法原子在上交会现场展示出的大脑能力,以及公开发布的Magic-VLA和Magic-Mix WM等架构,在我们看不到的地方魔法原子又做了哪些努力?除了这些硬核回答,张涛博士也爆料很多人关心的魔法原子的招聘条件。 【内容提要】 00:02:00 张涛与魔法原子 00:09:17 具身大脑到底是什么?具身小脑又是什么? 00:18:37 VLA or 世界模型? 是什么?怎么选? 00:33:23 具身智能的“L0-L5”,又怎么落地? 00:40:46 魔法原子的人才&团队:大模型sense靠小登,多元物理世界靠中登,那老登? 00:44:00 数据金字塔尖尖是机器人的"错题集”,用失败数据逼近99.9%成功 00:50:11 魔法原子冰山之下的数据飞轮 00:56:55 在学术界和工业界,具身如何进化? 01:05:52 行业洗牌,具身GPT时刻什么时候到来? ——节目中提到的具身智能相关的概念—— 1.LLM到VLA的模态叠加示意图 2.Magic-VLA架构图 3.Magic-Mix架构图 4.数据金字塔示意图 5.魔法原子的冰山理论示意图

番組について

欢迎来到量子位会客厅~ 一起追踪人工智能新趋势,关注科技行业新突破。