卫诗婕|漫谈Light the Star

卫诗婕

更有生命力的科技商业访谈。 Explore better tech reading. Hello~如果是新朋友,推荐几期具代表性的必听节目:1.感受创始人访谈的魅力——第40期(影石JK)、第51期(Plaud许高)、第34期(fellou谢扬);2.感受商业和良知的魅力——第24期医改与集采(必听)、第28期英伟达、第25期聊回购。相信听完这几期,会对这档节目的定位——做最有生命力的科技商业访谈——有更具象的认知。(公众号、各平台视频账号同名) 我是诗婕,做过社会调查、特稿记者、科技媒体主编。关注科技商业进步与公共利益~我会把自己持续学习的过程开源给大家,在这里也能学习AI、具身智能、全球化等前沿领域。在这里,点亮科技星空。 希望一起描绘、定义、推动一个更美好的世界。:) ———— 关于诗婕:虎嗅2024年度作者、金字节奖年度新锐作者、网易非虚构文学奖年度作者、全球真实故事奖TSA(True Story Award)。 合作洽谈 👉 微信:SJ_Jelyne(添加请备注身份+事由) 听友读者互动,欢迎加入听友群(每期节目简介会更新群二维码)

  1. 4d ago

    81.Agent Infra,巨头都在布局的隐秘赛道|与百度王雁鹏聊模型、智能体与 AI 基建的新动向

    我们正经历从模型时代到 Agent 时代的过渡。 底层技术正在发生怎样的演变,有哪些硅谷与国内的重要 AI 趋势?为什么这是工程师最好的时代? 这期播客,我邀请了百度智能云AI 计算首席科学家王雁鹏,深入探讨 Agent Infra 这个重要的「隐秘战场」。 (本期视频版也已上线:欢迎前往 b 站、视频号、小红书等平台观看~) 本期嘉宾:王雁鹏(百度智能云 AI 计算 首席科学家)本期 Shownotes:01:46 模型动向、AI 基建正在发生什么? 什么是 AI Infra?「Infra 其实就是抽象一个层次,这个层次有足够的通用性。」 AI Infra 为什么从软件走向软硬一体?「前一代的 Infra 基本上全是软件视角,这一代 AI Infra 有一个巨大的区别:它是以 GPU 为核心构建的。」 GPU 极大释放了算力,但是牺牲了通用性 从 AI Infra 到 Agent Infra ,意味着什么?「完成真实任务意味着我得有一个完整的环境,人操作的所有基础设施和软件,都要被 agent、被 AI 去用。」 04:25 Agent 从 demo 走向生产环境,还差什么? Agent 的三阶段 —— 从 Chat 到「完成岗位」的鸿沟 模型能力边界,决定 Infra 抽象层在哪里 新时代的数据库是什么,memory 系统长什么样,还在变化 模型的智力等于算力,算力等于电力 Agent 可控、可信任:每一次执行结果不变、可重复 基础设施层面,需要构建一套能够快速部署、快速开发、大规模运行的系统,一个更强的推理集群 12:03 OpenClaw、Hermes 与 Agent harness 的范式变化 「Claude 4.5 出来时,程序员圈已经被震撼过一波」 「Openclaw 第一眼没什么特别,再看还是有点东西」 harness 的三件套:loop(主循环) + tools(调用工具) + memory(记忆系统) loop 的通用性极强 :「让大模型看上一步结果 → 分析问题 → 决定下一步 → check 是否达标」 Memory 从 RAG 演进到文件系统:更通用 Hermes 的更进一步 —— 自动净化 skills(定期反思:这个任务哪里不好、下次怎么做更好、整理成明天可用的 skill) 18:44 模型即 OS :大家争夺的都是超级入口 为什么 agent 会越来越多:大模型以后会是 OS,是大脑 通用大脑就像天才:可以做任何事,但不会 day1 就能做任何事,中间的学习成本 + knowhow 沉淀 = 应用层的价值 Agent 的三大支柱:长上下文冲击算力、存储、网络与 CPU 消耗 CPU 的消耗,可以窥见 Agent 诞生了多少真实价值 「这仍然是巨头的游戏」 为什么英伟达的生态很难撼动? 36:42 Agent Infra,巨头都在布局的最吸金、最隐秘的赛道 智能 = 算力 = 生产资料 「所有巨头都会往下做垂直整合」 Anthropic、OpenAI、Google 的 Infra 路线差异: 谷歌,最典型的垂直整合派:TPU 做了近 10 年、JAX 自研、Infra 自研、模型自研 —— 芯 、 云 、 模真正一体化 Nvidia:不再是芯片公司,而是系统公司 Anthropic(轻资产,聚焦入口派):聚焦模型 + Claude Code 这个高价值入口;算力靠跟 AWS / Google 签协议保障,短期不用自己造芯片 OpenAI(重资产,生态平台派):「从 GPT Store 那时就想做 App Store 式生态」; 垂直整合的隐藏难点:「软件世界与硬件世界有 gap」 「今天定义的芯片两年半后出来时,还是不是那个模型需求?很大程度上不是」 NV 的缝隙在推理系统 51:19中国 Infra 路径:多芯适配、开源生态 国内 vs 国外 Infra 的两大差异: 芯片环境不一样:国外主要在 NV 生态;国内要考虑国产芯片、要做更多多芯适配 中国的开源远远领先于美国 —— 开源意味着**模型架构透明**,做芯片的能知道往哪里走 百度智能云的两个押注:更高的算力与 Token 效率 + 和未来的新星走在一起 Robin(李彦宏)提出的新指标 DAA(Daily Active Agents) —— 替代 Token 数量作为 Infra 层的牵引指标 「Token 数是一个会被玩坏的指标」:不能做杀鸡取卵的事 提升 DAA 的路径:**让开发更快** + 让运行更稳(可自动恢复、结果可 check) + 分任务价值高低(高价值多花功夫做) 趋势:从 Token 到 DAA :Agent 时代需要更多衡量真实价值 提升 DAA 的路径:让开发更快 + 让运行更稳(可自动恢复、结果可 check) + 分任务价值高低(高价值多花功夫做) 01:00:22 为什么这是工程师更好的时代 ? 更大的探索空间:做 Infra 的人在 CPU 时代不会在芯片层面想工作;到 AI 时代能做很多系统层面的事;到 Agent 时代要做更不一样的系统 当下,整个研究范式都在工程化: 「工程化研究范式」是这一代 AI 的隐藏画像 Transformer 架构统一之后,各家拼的其实是工程能力 「算法工程师」的时代结束了,「AI 系统工程师」的时代开始了 「今天你用工程的方法去解决更多、更广泛、更复杂的问题」 加入听友群⬇️: 在小宇宙查看该单集文稿

  2. Jul 24

    80.与梅涛院士的 3 小时访谈:语言、视频、具身终将汇聚,为什么是世界模型?

    从语言大模型,到多模态至全模态模型,再到走向世界模型… 世界正在经历什么? 本期节目我邀请了加拿大外籍院士、智象未来 Hidream的创始人梅涛,还原视频生成模型的技术发展史。 梅涛院士是全球首篇文生视频论文的作者,也是最早探索文生视频的人。 2026 年 5 月 20 日,Google I/O 大会上,Pichai 发布了 Gemini Omni —— Google 第一个原生「any-to-any」的全模态模型:文本、图像、视频、语音都在同一个 Transformer 里原生流动,不再是几个模型拼接——这与梅涛一直以来的主张不谋而合。 与此同时,OpenAI 悄悄砍掉了 Sora 项目,更多聚焦 Coding——硅谷正在做减法。 但中国一侧的多模态战场却没有收敛,从多模态、全模态到世界模型,多模的架构层面正在发生一轮新的分化:DIT、UIT、Omni 各自赌不同的路。 梅涛,作为最懂视频模型的人之一,正是选择从底层架构下场的创业者,他致力于打造「视频界的 Anthropic」。 我们从他的中科大、微软亚研院岁月,一路聊到这场世界模型的创业之旅。梅涛的模型世界观可以用一句话精炼,那就是: 图片是入口,视频是过程,世界模型是终局。 语言、视频、具身,终将汇聚。 这期的信息量极大,但技术门槛较高,不过,其中穿插着大量生动比喻,跟随下来,也能对当下的AI 趋势进行一场深入的了解。推荐大家收听~ 本期嘉宾:梅涛(加拿大工程院外籍院士、智象未来 HiDream 创始人) 本期 Shownotes:03:35 视频领域的 Anthropic :图片是刀, 视频是过程 学 Anthropic 的三件事: 团队从 OpenAI 出来后极度稳定(智象核心作者从 2017 年起就没走过一个)、坚定做企业服务、通过开源建立自我逼迫的创新节奏 视频领域的刀是图片 : 图片是二维/三维信号的入口,今天客户在平台上创作的时间 50%-60% 花在做一张图上 多模的成长路径:图片模型 → 视频模型 → 全模态模型 → 世界模型 能不能把图片做到全球最好,是视频公司真正的分水岭:Google 的 Veo 3 之所以强,是因为 Google 本身有很好的图片模型 08:25 院士里少有的「躬身入局」:全职 20 年的工业界履历 中科大→微软亚研 10 年→京东探索研究院 5 年→2023 年创立智象;从没拿过第二份薪水,始终全职 导师张宏江的习惯:看汇报从最后一页往前翻,5 分钟就把半小时的 slides 看完 「用 AI 分析理解视频」的任务,跨越 6 年才完成——多模态、全模态、世界模型都是那份实习任务的延长线 好的 mentor 给的 assignment 都不是「当下能做出来」的,而是「你的整条职业生涯都要围绕它推进」的 反人性才能获得长久的正反馈,负反馈也是正反馈 微软亚研院的土壤:这样的 R to D 通道今天几乎绝迹 29:00 微软 R&D 分离 vs OpenAI 融合:今天模型就是产品 微软时代:研究员做 paper → 10 个工程师转化成产品 → 100 个工程师做产品化,大半年才能进产品线 OpenAI 这一代:researcher 和 engineer 完全融合,R&D 之间不再有转化层 研究员今天为什么这么贵——因为他们直接是产品线;研究判断本身就是产品判断 如果你的研究和工程仍是两个团队,你比大厂慢的不是资源,而是决策速度 31:27 AI 不是足球赛而是篮球比赛:第一节快结束了 toC 是 toB 的放大器——C 端最先感知模型能力的溢出、贡献社区反馈、做 branding 中国 AI 创业的三个关键词:全球化、出海、软硬件一体 AI 的四节比赛:大模型比拼、 agent(通用+垂直)、终端流量入口/软硬件、第四节待定 AI 时代,toB 和 toC 的边界越来越模糊:创业公司不必二选一 后面的迭代周期会更短:基模半年一次大迭代,Agent 可能三个月一次,终端和交互还会更快 42:15 Sam vs Dario:一号位视角 vs 单点技术执念 Dario 是理想主义者(读社会学、历史、哲学);Sam 是投资人出身,更现实 讲宏大叙事等不到爆发那天就会死 中国投资人的三重反射弧——需要沿途下蛋、追共识不追共识外、经历过 toC 时代所以对 toB 天花板有本能的低估——这些都改变了中国创业者能选的叙事结构:你必须在讲远期愿景的同时不断证明近期商业化 「长期看 Anthropic 和 OpenAI 的曲线一定会交织」 47:10 从 TGANs-C 到 UiT:做视频模型,创业公司为什么必须换架构 做出全球第一篇文生视频论文 TGANs-C (2017):使用 GAN 与卷积神经网络,只能生成约 3—4 秒、48×48 像素的模糊视频,但证明了文本可以反向生成视频 视频生成模型经历了 GAN、Diffusion、DiT 几轮架构变化:主干网络从 CNN 换成 Transformer 后,模型才获得更强的上下文和规模化能力 DiT 需要先把文字、图片和视频压进隐空间,再编码、解码;压缩会损失细节,也让像素级控制变得困难——字节等大厂可以在此基础上大力出奇迹,但始终有些事做不到 智象在探索的UiT: 尝试取消外部 VAE,让原始像素、文本 Token 和任务条件进入统一空间,直接完成跨模态交互 创业公司必须思考如何避开大厂的车辙,如何优化成本曲线,逼近大厂的优势 「架构上的领先只能持续六个月」:开源是一场持续创新考试 为什么视频模型目前仍然是创业公司玩得起的游戏?千卡级训练仍给创业公司留有窗口 01:17:15 像素没有统计意义:多模态还在 GPT-2 阶段语言是经过人类数千年压缩的结构化知识,而视觉信号缺少公认的 Token 定义,「像素没有统计意义」 文本可以用 next-token prediction 自监督训练,图像和视频通常需要成对的内容与高质量描述,监督成本更高 视觉 Scaling Law 会出现,但不一定复刻语言模型的路径;数据、算法和算力都还没有形成统一范式 目前视觉不负责产生智能,而在于复刻 多模态消耗数据的速度仍赶不上人类产生视觉数据的速度 01:27:50 世界模型不是一个模型:三条路还没有交汇杨立昆的 JEPA 路线关注 next state 与世界状态预测;李飞飞更侧重 3D 世界重建;视频生成派则希望从海量真实视频中学习物理规律 视频模型的数据更通用、参数体量更大,可以成为世界模型的基础底座,再向具身或交互式任务迁移 图片、第三人称视频、第一人称视频和具身真机数据各自覆盖不同分布,单靠真机数据很难获得足够泛化 生成与理解目前仍是两套路线,真正的大一统架构尚未出现。 世界模型现阶段更像一组不同目标、数据和训练方式的模型家族。具身、3D 和视频都只是路径,过早把它们压成一个答案,会遮住真正的架构问题 01:41:16 从微软、京东到 HiDream:创业没有标准答案,在迷雾中寻找航向通用视频模型底座的商业化 技术创业选赛道时,「未来足够大」还不够。能否沿途形成收入、数据和产品反馈,决定团队有没有机会等到终局。 判断模型是否真正创新,不能只看公开榜单;模型公司会用自己的测试集和极限 Prompt 检查边界能力。 好的 Leadership :清晰目标、可执行路径、利他和技术使命感 快速不仅指把正确路线跑快,也包括更早承认路线不对 02:08:53 通往世界模型:下一代架构可能已在萌芽从多模态、全模态走向世界模型是通向 AGI 或 ASI 的必经阶段 当前的 Transformer 未必足以承载所有模态和交互,下一代架构可能已经在萌芽 让博士生和研究员持续筛论文、做小规模试错,再把有潜力的方向放大到产业级训练 发现下一代架构靠的不是一次灵感,而是一套持续感知机制 02:19:34 世界模型不等于具身:图片是扎马步,最大的数据量目前来自视频模型公司自动驾驶、视频、3D 和机器人都有各自的世界模型叙事。 智象的「具身世界模型」路径:先把图片质量做高,再扩展视频长度、实时性和可交互性,最后延伸到高精度的物理世界任务。 「像智象这样的公司,一年都是 100 PB 级年度视频数据」:视频仍是当前最可规模化的物理世界信号 图片不是视频模型的过渡版本,而是最低成本的基本功测试——构图、像素控制和角色一致性做不稳,视频越长,错误只会被继续放大。 02:28:49 多模态商业化:智能未涌现,表现力先变现「多模不会一家独大」 Agent 的价值不只取决于基模,还取决于 Harness、Skills、成本控制和行业 know-how 多模态还没有出现语言模型式的智能涌现,却已经出现表现力涌现。商业化可以早于技术终局。 「Token 将来价值会越来越薄,因为它成为了一种 commodity。」 02:42:06 船票的本质:模型能力与商业化都要过关一张多模态船票首先要求自研模型和公开可验证的能力;只有应用收入,也可能被下一轮模型升级吃掉。 模型层竞争是耐力赛,但资本耐心有限 2024—2025 年,一批视频创业公司批量退出牌桌 一级与二级市场都在寻找模型排名、对标逻辑和增长数字,但对「新型 toB」的共同要求,是不要回到私有化部署和定制研发。 02:54:55 卖铲子给具身:从世界中学习,再重构世界智象与诺亦腾合作: 具身公司缺少高质量、可规模化的数据 把真人遥操和夹爪数据扩增为不同背景、不同手部外观的第一人称视频 合成数据是否「真实」并非重点,重点是它能否提升 VLA 或 World Action Model,并用轻量模

  3. Jul 6

    79.机器人大脑第一股上市,与仙工赵越的4小时访谈:全球第一、机器人金字塔与具身智能的另一条路

    这是一期非常生动、系统的访谈,还原了一家隐形冠军的成长史与思维方式。 作为机器人大脑第一股(仙工智能已于2026年6月24日在香港交易所主板挂牌上市),仙工把机器人的大脑「控制器」卖向全球,成为全球出货量第一。同时,它也正在探索一条反主流叙事的具身大脑道路。 这是仙工成立以来及上市后,创始人首次接受深度深度访谈。此前,这家公司作风低调,鲜有接受媒体报道。 创始人赵越身上有许多有意思的故事:读医三年后退学重考、本科期间睡实验室、曾带领团队获得三届 Robocup 全球冠军、首次创业失败…… 大量成长过程中的趣事(尤其是在世界杯期间,我们聊机器人世界杯 RoboCup 聊了一个多小时),其实也与创业过程中的思考方式互文。 赵越带来一个有趣的暴论:未来所有公司都可以是机器人公司。也带来一些启示:越是纯粹的人,越有机会在专业领域获得成功。AI 时代,足够热爱的人将有更大机会获得成功。 强烈荐听这一期,希望你们喜欢:) (本期访谈的视频版已在 视频号、微博、b 站、小红书等平台登录,欢迎前往观看~) 本期嘉宾:赵越 (仙工智能创始人)本期 Shownotes:Part 1.关于赵越:史莱姆、「卡拉米」和永远想「掀桌」的基因01:23 仙工的吉祥物,是小怪物「史莱姆」「开始都叫老板,新人一周内就会喊我越哥」 史莱姆(仙工吉祥物),最初级但也不容小觑的小怪物! 从 wrong 到 right,要经历漫长的混沌 创业本质就是不停解决问题的过程 「加速开放多元的智能文明,让智能机器没有门槛」 06:26 湖南邵阳,浙大 8 年医学本科、退学,与夺冠少年 父母都是老师,「他们最大的贡献就是不管我」 浙大竺院的宽口径培养:8 年医学制,读到第五年,我退学了 白天紫金港,晚上玉泉——本科研究生几乎睡在实验室,不认识研究生室友 Part 2. 中国摘得 RoboCup 世界首冠:一个「小胖子」带队夺得三届冠军 15:15 从「小胖子」Picker ,到三届全球冠军 关于 RoboCup:2050 年击败人类世界杯冠军 还没有 Issac 和 Sim2Real 的年代:用 ODE 物理引擎 + CUDA 加速做仿真 8 毫秒决策周期、集中式控制场上 6-7 台机器人、GPU 算所有跑位与形势变化 2009 年开始接触强化学习,「逐条过对手的比赛日志」 代码里的 magic number(阈值数):引入随机性,是最有效的策略(今天的创业同理) 「那个小胖子,你不要在场地上跑那么快!」 小卡拉米的蜕变规律:脱颖而出,往往不是因为优秀,而是因为热爱 30:14 中国首冠 & 一个「思想钢印」 初赛击败上一届冠军:整个场馆都震惊了 一个思想钢印的诞生:「你觉得是问题的、迟早有一天会找过来」 击败 CMU(卡耐基梅隆大学,机器人领域全球最强的实验室):把不可预测,转化为可预测 「太精彩了,不像机器人在对抗,像两个教练在对抗!」 与 Malona 在巴黎的会面(RoboCup 发起人之一,执行委员会主席):RoboCup 播下一片种子 热爱,无法伪装 Part 3. 未来,B 端不会有真正的机器人巨头出现:每一家公司都可以是机器人公司53:21 机器人金字塔:能在底层解决的,不要往上层解决机器人金字塔:机械 → 电子电路 → 底软 → 通讯 → 算法 → 模型 端到端 vs 分层架构的技术路线分歧:未来所有大脑模型,也会是 MoE 架构 自上而下 vs 自下而上的两派大脑 快速分裂 & 快速共识:2022 年大家讲 VLA、2024 年讲世界模型、2026 年讲无本体采集——共识每年重新洗一遍 具身分两维度看:**新技术范式 vs 新产品形态**——可以分别独立验证、没有必要绑在一起 数据如何低成本、可持续地涌现? 01:06:23 暴论:「所有公司都可以是机器人公司」 渐进式在 B 端赢、颠覆式在 C 端赢 「一吨货的三种解法」 工具是被人创造的——让人形去搬货,就像让自动驾驶去开油车,是退步 数据 ≈ 模型:一个拥有足够多好数据的公司,可以立于不败之地 好数据的三条件:① 真实场景采集的多样性 ② 天然对齐(不用花大量成本转格式) ③ 低成本可持续产出 仙工的独特资产:2000 种机型 × 400 种传感,接在自家传感器上,天然对齐;客户异常时主动把 corner case 给你 为什么不立刻训一个通用大脑,而是训垂类模型? 产线没有巨头、机器人为什么一定要有标准的巨头? 构建事实标准,与「反者道之动」 01:22:38 从方法论焦虑,到数据坚定 「现在这些 BP,没有 VLA 的我都不看了」 问题不是方法本身、而是数据 自动驾驶出身的,都会强调真机数据 新方法研究,是一个沿途下蛋的过程 挖角潮有感知,核心员工几乎没走 无为,是不妄为 01:53:16 第一段创业的失败:富士康点醒了我们 第一段创业「仙知」:沿着机器人四大家族一路模仿,发现似乎不对 富士康点醒我们:除了控制器,没什么是我们不能做的 与富士康的交易:交出图纸,买你系统 一台机器人上难以被统一的需求:当你把它升维到软件工具链层面,都能被统一 第一段创业的教训:现金流危急一年多 Part 4. 仙工的具身大脑路线:不立刻去训通用大脑,掌握数据会利于不败之地02:10:00 机器人平台化战略的诞生:脏活累活,是护城河 控制器就是机器人的大脑(硬件承载 + 软件规则或模型) 仙工如何成为机器人控制器全球第一? 能不做的,都不做 海外市场与中国市场的差异 我们组建了一整套严选和评测体系 我们不做零件的原因:中国公司太厉害了,未来第一名不会有中国以外的公司 脏活苦活,才是一个科技公司真正的壁垒 02:36:19 谨慎做梦:可靠性、泛化性 & 后发优势 战略是长期的、不可撤销的投资 具身的实用主义:一端要可靠性(强化学习把场景打到极致),一端要泛化性——「两端兼具,至今我没看到信服的案例」 每次从 0 到 100,是为下一次从 0 到 1 换筹码 谈具身落地的真相:「大多数应该是不及预期的」 仙工的具身「四象限理论」:把「新旧技术」× 「新旧产品形态」拉出四个象限 新技术 × 旧产品形态(比如叉车具身化)——做落地引领者 旧技术 × 新产品形态(人形机器人的下层运控)——做具身行业的赋能者 新技术 × 新产品形态(比如具身大脑训自己的通用模型)——当下不做,全力积累数据 旧技术 × 旧产品形态——放弃 关于人形:不是没价值、是这套「基于数据训模型」的范式在人形上暂时难落地 Part 5. 道德经、鲁路修与稻盛和夫:「干掉第一」、「成为第一」、「不做第一」《道德经》的「空」,与不妄为 「功成事遂,百姓皆谓我自然」 稻盛和夫和毛泽东:极致唯心 + 具体唯物的辩证 钢炼、鲁路修、高达、进击的巨人:神漫里有着美好的世界观 鲁鲁修震撼了我的世界观:主角让自己变成世界最大反派、被最好的朋友一刀刺死,用自己献祭了正义 消消乐哲学:做到第一就要清空重来,否则容易变成那条恶龙 加入听友群⬇️: 在小宇宙查看该单集文稿

  4. Jun 26

    78.Seedance之后,视频Agent何去何从?|与 OiiOii 闹闹聊视频模型的秘密:数据、生态与感性的结构化

    Sora 之后,Seedance、可灵等国产视频模型,做出了世界的高度——中国视频模型为何能领先全球?Seedance 的发布(最新已经是 Seedance 2.5 的发布啦),究竟是结束了视频 Agent 的战争,还是开启了它? 我和 OiiOii 创始人闹闹,一起还原了属于视频战场上的大模型及智能体之战。 (本期内容详细梳理了 Sora 之后,视频模型的发展,及视频模型训练背后的人才体系、训练方法、数据奥秘,非常值得一听,也欢迎前往各大平台-B 站-小红书-视频号等,搜索本期内容的视频版😁) 从腾讯微信、字节剪映到创立 OiiOii,闹闹特别分享了她的产品世界观——感性与理性,是一体两面。而在视频这个领域,感性如何被量化,既是科学,也是艺术。 本期嘉宾:闹闹(视频 Agent OiiOii 创始人,前字节剪映负责人)本期 Shownotes:02:01 Part 1. 闹闹的成长史:观察者、群体之外与"创造环境"当一件事需要你自己去创造一个环境 腾讯和字节是产品观的左右脑 张小龙的 8 小时内部产品演讲,"他用人类外的视角在观察人类——把人性的善和弱点放在放大器里发酵,再像园丁一样修剪” · 在字节学到数据的应用,也看到数据的滥用——明知一个实验数据怎么才能为正,就为了正而去做它,但这不代表它长期是正的 内容型产品的核心,是把感性的好与不好归类量化 18:27 Part 2. 视频模型路径的判断:从 Sora 2,到 Seedance早期视频模型以首尾帧为主——Vidu 第一次把“多参考图"这个概念做出来 Sora 2 验证了多参方向,开拓了模型的想象力 “Seedance 基本是 Sora 2 的升级版” 什么是视频生成的最佳实践? “描述词要加正向和负向词,要叠加约束” “视频生成交互的下一步不一定是文字” 27:28 Part 3. 为什么最好的视频模型出现在字节快手这样的短视频平台?“视频模型不是创业公司该做的” 大公司的数据护城河:有过去做图形图像算法的积累,可以制定标注标准,执行到八九十分 可灵的前世今生:2021 年,快手 Y-tech 算法团队在视频理解上就不弱于(甚至强于)字节 AI Lab 两条视频模型路径:通用大底座(Seedance) vs 专业领域优先(可灵) 生态是分水岭:同样的算法,能不能用好这些数据,取决于过去推荐系统里有没有相关应用经验 中国为什么能在视频模型方面领先? OpenAI Sora 的失败不是技术失败,是生态失败 视频模型领域的护城河不是算法,是"数据标注标准 + 组织执行力" 34:15 Part 4. 模型不会被吃掉 Agent 的部分是?harness & 感性 benchmark 视频模型目前的不可能三角:效果、生成时间、生成成本 模型会往哪些确定性的方向迭代? 多模和语言模型有哪些本质不同?——感性可以被结构化但颗粒度更粗 Harness 一定会进入多模和视频领域 42:33 Part 5. AI 时代的「剪映」(or not ):第二次创业为什么是 OiiOii ?AI native 的产品需要新形态 关于创作者的物质激励 & 精神激励 动画是 Agent 适合进入的绝佳行业 模拟剧组:OiiOii 的 7 个角色、改变生产组织、抽卡降本 内测码 10 万人排队的原因 Seedance 给我的冲击有哪些 MidJourney 没被吃掉的原因 OiiOii 的产品团队,由谁构成 57:02 Part 6. Sora 关停与 Seedance 2.0:视频 agent 战场是终结了,还是开启了? Sora 关停——它做错了什么? Seedance 2.0 是升级版的 Sora,它的弱点是什么? 海量视频 agent 涌现是"妄想"?——哪些套壳在骗钱? 怎样的产品是“纯套壳”?鉴别 Agent 的厚度… 视频领域不会 winners take all … 为什么抖音特效的参考意义极大… ACG (动画、短漫剧、游戏)的 Agent 机会:生产关系的改变才是更值得思考的价值空间 我与字节:「你要相信字节是一家非常精明的公司…」 如何侦查模型厂商动向? 01:32:18 Part 6.「这个时代最缺的就是谦逊」模型涨价了怎么办? 国内 agent 调度的视频模型有? Seedance 最值得学的是什么? AI 时代顶级产品经理画像长什么样? AI 时代的自信与盲目 如果喜欢「漫谈」,欢迎加入我的听友群~⬇️ 在小宇宙查看该单集文稿

  5. Jun 16

    77.有关智元、觅蜂的愿景与野心,和具身智能的竞速之旅|与姚卯青的对谈

    2026 年,具身智能成为了聪明人扎堆、资本热潮近乎疯狂的行业。这条热门赛道中,智元机器人是最早的百亿俱乐部成员之一。 在人形机器人出货量狂奔的路上,智元的野心并不止于“具身本体”的军备竞赛。今年,他们做出了一个让全行业瞩目的反哺举措:将旗下的核心数据资产彻底剥离,独立孵化了全球领先的一站式物理 AI 数据服务平台——“觅蜂”。 本期嘉宾姚卯青,不仅是智元合伙人、具身业务部总裁,也兼任觅蜂的董事长兼CEO。这期播客在五月觅蜂发布会后录制,或许是有关智元战略的,最深入完整的一次访谈。 (本期视频的微博开屏页,欢迎前往微博等平台观看视频版~;也欢迎前往公众号,查看「漫谈Light the Star」访谈的文字版~) 从Waymo到蔚来再到智元,姚院亲历过自动驾驶从概念到量产的全过程,他说“今天的具身智能连GPT1都没到”,而机器人离真正涌现智能,还差一亿小时的数据。 本期嘉宾: 姚卯青(智元合伙人、通用业务部总裁, 觅蜂董事长兼 CEO) 本期 Shownotes:Part 1. 02:40 关于姚卯青:从清华电子系到南加大,从 Waymo到蔚来「人间清醒」与「顺势而为」 清华电子系的系统训练:电路、通信、信号处理、计算机视觉、编程和算法,都是自动驾驶和具身智能的底层能力 Google Display Ads 团队:计算机视觉、NLP 与 Transformer 内部转岗 Waymo:可能是当时全球最难的面试 Waymo 的三年: Robotaxi, 从技术 demo 走向商业化运营 Part 2. 17:28 蔚来的量产课:激光雷达、车规体系和数据飞轮为什么选择蔚来? 「单平台、全标配」的产品策略,激光雷达、4K 相机和高算力硬件一体的统一底座 蔚来李斌:「被人骂也是被记住的一种方式」——做关键决策需要勇气 多模态融合感知、激光雷达感知、BEV、Occupancy Network、AEB …关于自动驾驶的种种 选择回国:相比 Waymo 的几百辆 Robotaxi,国内乘用车百万级保有量所带来的数据分布和 corner case 密度,是完全不同的飞轮 量产经验到底是什么?「不是把样机多复制几台,而是项目、研发、测试、供应链、质量、版本和数据闭环的组织能力。」 能迁移到机器人的是什么?异常数据回流、模型迭代和现场版本下发 Part 3. 28:31 当自动驾驶派进入具身:优势不是算法,而是底座自动驾驶派进入具身智能,最大的价值是理解强电系统、供应链、质量、量产和底层软件稳定性 机器人和车,在电子电气架构、操作系统、中间件、传感器输入到电机控制等底层工程上高度相通。 车就是最简单的机器人?「有点牵强」 在很多低速场景中,机器人反而更有机会部署 VLA、世界模型等前沿模型 真正稀缺的人才,不只是刷榜或发 paper 的人,而是上手修过 bug、和硬件软件都打过仗、能把复杂系统跑稳定的人 具身创业的三大派,都有不可替代性 机器人终局架构不会只是「快慢系统」两层,可能包含: 1000Hz 底层控制、10 到 20Hz 动作规划、1 到 2Hz 阶段目标规划,以及更高层的 Agent 长程推理。 Part 4. 35:19 讲「基模」太早了,具身连 GPT 1 都没到呢!「2026 年了,具身智能到底到 GPT 几了?其实 1 都没到呢」 「现阶段的真机数据量,和真正支撑基座模型涌现的数据规模,还差四五个数量级」 很多公司强调自己做「具身基模」,是借用了大语言模型时代的资本叙事 今天的具身更像 Transformer 和 BERT 早期,而不是 GPT-3 之后 数据的关键不仅是「量」,还包括信息维度、场景种类、失败样本和真实部署中的边界样本 多模态融合是必然趋势,视觉远远不够 真正的瓶颈不是算法是否足够聪明,而是真实世界数据的量、模态、场景和失败样本远远不够 Part 5. 49:59 有关智元最完整的战略揭秘:一家 AI 公司,而不只是机器人公司神秘的邓泰华其人 智元Day 1 定位成 AI 公司,而非单纯的人形机器人公司 人形机器人是把 AI 带入物理世界的必要载体,但不是终点 「智元确实是这个行业里最有野心的公司之一」 智元的组织架构、融资节奏与股权激励 具身公司的长期价值不只在本体硬件,而在能否把「本体、数据、模型、场景」做成闭环。 精灵 G2 所经历的完整 IPD 流程:接近 9 个月 机器人行业的需求峰谷比汽车更剧烈 工业不相信眼泪,最终都是 ROI:「」工业客户不关心你是人形、猴形还是狗形」 智元的「358 战略」:从量产、商用到部署 具身智能最终不是单点技术竞赛,而是系统工程。 当技术路线逐步收敛、场景开始渗透时,先把 90% 的体系能力构建好,才可能真正承接行业机会。 Part 6. 01:55:26 VLA、世界模型和机器人数据飞轮智元的 AI 研发体系:模仿学习、VLA 预训练、世界模型、强化学习后训练和数据闭环 Google PaLM-E :VLA 来自语言模型和多模态语言模型向物理世界的迁移 世界模型更像对物理规律和状态转移的数字化、神经网络化描述 「VLA 和世界模型都不是最终形态,未来更可能是分层架构」:前者受限于语言和动作之间的表征鸿沟,后者仍更多来自二维视频和第三人称视角 :语言推理、物理预测、低层控制、长程规划和数据飞轮共同工作 世界模型的价值在于学习液体流动、玻璃破碎、软体形变等真实物理规律 「后训练和失败数据非常关键」 Part 7. 02:08:49 觅蜂:具身版 Scale AI,机器人数据界的「滴滴」投资人的主意:对标上一轮 AI 时代的 Scale AI ? 具身数据生意比传统数字世界标注难得多 2026 :具身数据军备竞赛年 模型的差异化暂时不大,数据会是分水岭 打造一个公共性质的数据服务平台,一个「阳谋」:客户花钱带来数据需求,平台用数据训练模型,模型再反哺采集、预标注和质量管理效率 数据问题都没解决,讲基模预训练、后训练,都是空中楼阁 高质量数据的第一点是真实:场景和任务必须足够丰富,能够覆盖生活和生产中真正会遇到的问题 规范:相机曝光、画质、设备同步、轨迹重建精度、操作流程都要高标准 「脏数据」不是质量差的数据,而是包含失败、偏移、纠错、重新规划和最终成功的多样化数据 仿真数据并不天然低价值 关键不是流派,而是任务、场景、成功率要求和模型使用方式 数据的价格、产能和全球化 Deepmind 和 Genralist:「如果数据是具身智能竞争的唯一决定变量,中国公司现在就可以宣布他们是赢家」 As many as possible, as soon as possible(越多越好,越快越好). Part 8. 02:43:43 从数据标准,到 G3-G4 中间态好的数据标准会逐步收敛 即使不同机器人硬件不统一,很多数据仍可以被抽象为通用表达,如末端执行器轨迹、二维帧序列、物理状态变化等 机器人行业的安全和质量准入标准,会在两到三年内伴随大规模商用逐步出现。 从 G1 到 G5 ,当前行业大约处在 G3 到 G4 的中间态 预计 2027 到 2028 年行业有希望达到 1 亿小时级数据规模 真正类似语言模型那种涌现能力,还需到 1 亿小时级高质量数据出现 Part 9. 02:54:42 最期待的画面:机器人第一次让人觉得「觉醒了」机器人出现真正的 aha moment:不再只是从画面到动作的肌肉映射,而是能在复杂环境里自主规划、理解指令、做出响应 涌现时刻大概率发生在实验室,而不是工厂 数据会成为这一轮智能化转型关键基础设施,但它比算力更难获取 加入听友群⬇️ 在小宇宙查看该单集文稿

  6. Jun 12

    76.与 00 后创业者源培的访谈:从 RoboMaster 到李飞飞实验室、两次「全球首次」,与自由快乐的非标人生

    AI 原生一代,将写下怎样的新故事。这是这一轮 AI 浪潮以来,投资人们最关心的问题。 今天的访谈嘉宾,是 00 后具身创业者,陈源培。 他曾在斯坦福李飞飞的实验室,实现了全球首次双臂长程灵巧操作,以及全球首次「用人类数据训练机器人双臂灵巧操作」。 土木工程本科出身的他,高考前一天还在打游戏,却通过 Robomaster的比赛结缘机器人,并跨界师从北大强化学习专家杨耀东,成为强化学习的前沿学者,继而进入斯坦福李飞飞的实验室,做出全球首创的成果。 相比「天才少年」叙事,这期更值得品味的,是一个一再印证,学习没有固定范式、创新没有标准答案的故事。以及开放、多元、包容和谦卑的学术品味与视野。 无论游戏、RoboMaster、科研,在源培那里都有一条共同线索:它们都像升级打怪,靠快速学习、持续探索和反馈提升能力。希望其中的思考方式,能给大家启发。 (本期视频欢迎前往 b 站、视频号、小红书、Youtube 等平台观看~) 本期嘉宾:陈源培,灵初智能联合创始人 本期 Shownotes: 02:51 从游戏到 RoboMaster:工程能力从系统里长出来高考前还在打牌的 00 后:通宵打游戏,差点被选去电竞青训 父母最大的影响是「完全不管我」 大疆 RoboMaster 冠军:机械、电控、嵌入式、上位机、控制、算法…训练的是复合能力 深入代码底层,不会并不是一个门槛 机器人并不是单点算法问题,全栈系统思维是稀缺的 工程性的东西,更多看的是细心程度与快速学习能力 俄乌战争给源培的「觉醒」——突然觉得发 paper 、抠创新点,对世界没什么帮助 16:41 师从杨耀东,最早 Isaac 使用者与并行仿真师从强化学习知名学者杨耀东,用强化学习做灵巧手 零帧起手强化学习 OpenAI 的 Shadow Hand (2019)的解散,强化学习解魔方——酷但昂贵 「我是英伟达 Issac 最早的使用者」「那个版本应该绝版了」 「未来用 GPU 做仿真,一定是大势所趋」 首篇论文即震撼行业:高自由度操作可以在大规模并行仿真中训练出来 35:05 强化学习 vs 模仿学习,什么是训练直觉?强化学习的峰回路转:监督学习和模仿学习的短期效果让强化学习一度被质疑;直到O1 等方向又重新证明了强化学习的价值 模仿学习见效快,但泛化弱;强化学习潜力大,但极吃 Know-how 模仿学习不是未来 从人手中心到物体中心:描述物体轨迹如何变化,让机器人知道大致目标,再在小范围里探索 奖励不需要把每个动作写死,需要留有空间任 AI 自己探索 真正的系统能力是「方法都告诉你了,但你调不出同样效果」 我训强化学习还挺厉害的:「基本上大家以前都看曲线,只有我是打开仿真,盯着机器人学习。」 43:37 进入斯坦福李飞飞实验室:从强化学习中心主义,到多元的学术视野,与技术地图每条路线都有价值,未来更可能是吸收各自优点的融合过程 更开放的研究氛围:连接图形学、灵巧手、模仿学习、人类数据 师从 Karen Liu :把机器人操作、动捕、人类数据和仿真强化学习连接起来 不要太 Ego,不要靠形容词证明强,让结果本身说话 一周可以水一篇顶会的代价是放弃自己其他可能性 「从斯坦福回来后,他像变了个人一样」 50:51 跳出舒适区 + 螺旋上升的具身技术史具身技术发展的螺旋:抓取→ CV+模板 → 直接学轨迹(模仿)→ 人遥操太慢 → 强化学习自己探索 → 仿真效率低→ Isaac Gym 并行仿真+Sim-to-Real → Sim2Real Gap 太大→ 软体场景模仿学习反超(Diffusion Policy/ACT)→模仿学习也不够→ 后面接强化学习→世界模型起来后,又回到仿真训 RL 灵巧手最大的价值,不是因为它像人,而是因为它最容易吃下人类操作数据 与夹爪或专用末端执行器相比,五指手和人手之间的 Embodiment Gap 更小,更适合做 Human-Centric 数据采集 「以物体为中心」的通用表征:操作的本质是让物体沿某条轨迹发生变化,而不是复刻人的每个关节动作 具身 Scaling Law 的核心可能不在遥操数据,而在人类日常操作数据; 硬件形态本身会决定能吃下什么样的数据 Sequential Dexterity 的祛魅:学术需要 novelty,这没太大意义 58:26 仿真派的价值和上限我曾经就是个仿真派 仿真无法根本解决真实世界复杂交互,尤其在软体、碰撞、接触和高精度成功率方面 可微仿真和世界模型都试图缩小 Sim2Real Gap,但目前仍受限于算力、图形学、物理交互和数据量 仿真 vs 真机,谁快?仿真的场景 Scaling 能力未必比真实世界快 仿真可以做出很 Fancy 的 Demo,但不是当前可见的终局 如果世界模型足够强到生成全场景仿真,它本身也需要先吃下海量真实数据——如果做出了世界模型,那肯定先做出了好用的 VLA 一个研究者最重要的能力不是在舒适区里把"已经会的事"做得更深,而是逼自己跳到不熟悉的方向;这一点反人性反惰性,因为你在擅长的方向也确实有想探索的东西 01:17:02 具身 Scaling Law 会撞上硬件问题具身 Scaling Law 的核心问题是数据,单靠遥操数据很难堆到足够规模 百万小时级别的人类中心数据,至少能让行业看到一些效果 「我是实用主义派」 与语言模型不同,具身智能会遇到硬件差异:不同手、不同本体、不同自由度都会影响数据和模型泛化 跨本体泛化的关键,是提取人类操作中通用的信息,再用强化学习补足机器人具体关节、力和接触细节 语言模型可以在统一的 token 空间里 Scaling,具身智能必须同时解决数据规模和硬件本体差异 01:22:12 创业后的路线选择:先坚定,再快速调整2024 创立灵初时,市场上很少有人强调灵巧手操作和强化学习 择做长程灵巧操作、强化学习、人类中心数据和双手路线,对于一家创业公司,是信仰和耐心的考验 要去做别人做不到的事 当前的路线没有不能复刻的,都不够本质:但仍然保持灵活,可快速调整 具身创业的难点是同时平衡商业化和预研,短期场景可以做,但公司不能忘记自己到底是不是模型公司 「你不能有包袱,最后还是结果说话。」 01:38:04 世界模型、VLA 和算法口号的泡沫灵初的具身大脑是糅合路线:硬件、采集、数据处理、模型训练和部署,形成端到端闭环 模型架构和口号本身不是护城河 广义 VLA 只要输入视觉和语言、输出动作即可 World Action Model 也只是增加未来帧预测等辅助监督 单靠改模型架构、模块连接方式就带来突破性变化,我认为这几乎是不可能的 真正重要的是训练范式、数据规模、数据质量和完整 Infra 马斯克为什么不喊世界模型——世界模型本身不产生价值,真正产生价值的是它能否在具身、能源、航天或其他真实任务中解决问题 具身行业的泡沫:太多人说的和做的不一样,一些投资看不太懂 01:45:05 主动世界模型:从数据里选择有用信息关于「主动世界模型」的思考:机器人需要主动判断哪些信息有用,哪些是噪声 世界感知分成客观世界规律、主动选择机制和自身 Policy 三层,其中最缺的是中间那层主动选择 数据 Scaling 不是无脑加数据,低信噪比数据可能损害模型能力 我是实用主义:脑科学、神经元结构、主动世界模型等想法都可以借鉴,但必须通过效果验证 具身下一阶段的底层创新:可能不是继续堆模块,而是找到类似语言模型 next-token prediction 的训练范式 02:03:15 「我的人生,绝对不可能不快乐!」——兴趣、非标与系统性思维不要害怕环境、专业或起点带来的限制,去做自己真正感兴趣的事 机器人人才,最重要的三点:追求卓越、系统性思维、不要太 Ego 「再垃圾的 paper,也有你可以学习的点!」 「我追求的是影响力,对真实世界产生价值的影响力」 未被验证的人才和未被验证的路线,可能写下真正的突破 加入听友群⬇️: 在小宇宙查看该单集文稿

    76.与 00 后创业者源培的访谈:从 RoboMaster 到李飞飞实验室、两次「全球首次」,与自由快乐的非标人生
  7. May 29

    75.登顶大摩全球人形机器人报告,灵初凭什么代表中国?|与创始人王启斌聊「灵巧操作」

    2026 的上半年,中国资本市场围绕具身进行了大规模的布局,将具身大脑这个赛道推向了前所未有的热度。 这期的嘉宾灵初智能,刚刚登顶了摩根士丹利最新发布的《全球人形机器人研报》,它被视作中国具身大脑阵营的核心代表之一。从灵巧操作出发,这条大脑路线直指智能的上限。 创始人王启斌是 70 后产品背景,乔治华盛顿大学博士,完整经历了"智能设备 → 移动机器人 → 具身智能”的三次范式更迭。 我们的访谈不仅涉及到大量具身行业的真实进展,也描绘了在具身这个早期行业中,从研发(R)到工程(D)到产品(P),所谓 RDP 的全流程。 2024 年,70 后王启斌,和80 后算法老兵柴晓杰、 90 后北大学者杨耀东、00 后天才少年陈源培,组成了灵初智能这支具身“7890 战队”,成为这个行业背景最豪华的团队之一。 (本期访谈的视频版已经登录 B 站、视频号、微博、小红书、Youtube 等平台,欢迎前往观看~,文字版可前往公众号「卫诗婕 漫谈 Light the Star」) 本期嘉宾:王启斌(Viktor)· 灵初智能创始人本期 Shownotes:Part 1. 00:00-08:56 让机器人「动手」,为什么是皇冠级的大脑问题?灵初是谁? 被摩根士丹利视作中国大脑核心代表,灵初是谁? Hugging Face 上 1000 小时多模态数据集下载量第一 希腊字母第 23 个 Psi(Ψ),意指强化学习,「像孩子一样在环境中交互、逐渐长大」 为什么做大脑的公司普遍估值更高? 什么是通用灵巧操作?为什么说人类操作数据是一座富矿? 操作的三种能力:对任务做长程语义分解(规划)、手眼协同、实时纠错人类能力的演进顺序:行动最早(灵长类)、视觉次之(寒武纪)、语言最晚——而机器恰好相反机器人不一定像人类那样大脑/小脑严格分开,目前没有完美的大小脑结构能拟合类人能力夹爪很难做类人复杂操作操作知识不具备可传承性——如何把人类经验挖出来变成可训练的数据,是具身要回答的根本问题 Part 2. 08:56-20:04 Why now:具身浪潮,周期与淘汰赛2026,具身为什么更热了? 「新的浪来了」:过去几波范式不会持续这么长why now 的底层:具身是真正回到物理世界的问题 具身的市场,只会比智驾更大:上一波公司的顶点,可能是下一代公司的起点 跑完一个 cycle 约 7 年:至少会有三轮淘汰赛 关于王启斌:黑莓vs苹果,一个产品老将经历的范式更迭 黑莓曾是全球唯一净利率 25%+ 的公司(另一家是苹果) 从苹果开始,ToB/ToC 没有绝对分割 什么是苹果真正的胜负手? 新世界物种对旧世界的降维打击,是如何发生的? 「站在旧世界的人不用 complain,这就是宿命。」 「当年带 Sonos 全球 CEO 见百度陆奇,是我的心结」 什么样的 ToC 产品能击穿 ToB?苹果做到了。具身领域有机会吗? 20:04 中美硬件之争,穿越周期的产品经理,与审美 审美的物质基础:Jony Ive 的设计传统在英国,小米设计领导人传统在德国,消费电子审美在欧洲Sonos 和 B&O ——两种产品哲学小米生态链/IoT 兴起(2015)后,中国消费电子工业设计的崛起&底层:从整机到核心零部件的全链路掌控 + 快速迭代 Part 3. 中美硬件之争,两代机器人公司,谁会赢?「美国大脑领先、中国硬件领先」,人们只看到了轨迹的起点 为什么从泛化性居中、节拍较低的物流和服务业 toB 切入 5 年内「只做模型不做硬件」是伪命题——具身现处于软硬深度耦合阶段 落地两种形态:固定上半身、可移动+上半身——两种构型,训同一个模型 具身的数据飞轮和车完全不同——车有存量市场,具身去年头部出货才 5000 台,飞轮必须靠人类数据冷启动 上一代自动化机器人 vs 具身新秀派,谁会赢? 上一代移动机器人靠 SLAM(2015 前后)和基于规则的技术,深耕单一场景;当下具身解决更复杂的操作问题,用 learning base 的学习范式,人才完全不同 三个顶层问题:解决什么问题、用什么技术路线、什么样的人才; 创新者诅咒:成熟公司有自己的场景循环,可能恰恰是负担 仓储物流、无人配送领域,全是创业公司赢了(海柔、极智嘉、新石器)——阿里、美团、京东,为什么都落后了? 「原来真的是书上得来终觉浅……谁有场景谁赢,是个错误。」 Part 4. 灵初的成立:7890 战队 & 科学家创业潮横跨中美,花半年时间找科学家: 国内能做灵巧操作的不超过 10 人 如何判断科学家是否适合一起创业? 在斯坦福李飞飞实验室的 00 后联创:强化学习,将人类数据迁移到灵巧操作的 Sim2Real 「7890 战队」:为什么具身需要的人才跨度大?跨代际和领域的融合难度? 怎样治理一个软硬数据耦合的复杂组织? 为什么「量产那套」不完全适用于具身大脑研发? AI 时代,为什么强调「治理」而非「管理」? 硬件派 vs 模型派的路线分野:从硬件出发(做到稳定便宜规模化,特斯拉思路)vs 从模型和数据出发(用优质数据训模型,灵初思路) Part 5. 01:01:06 具身数据的真问题,与中国的另一种叙事可规模化预训练的优质数据长什么样?数据管线怎么做? 算力、数据手套与数据飞轮:灵初的真实数据方法论 什么是检验真做大脑 or 水货大脑公司的金线? 数据洞察:手的 3D 关节角精确度 > 触觉 > 2D 照片; 全模态数据,比纯第一人称视频更精确丰富 行业最大的10 万小时手部多模态数据怎么来? 数据管线 = 数据处理平台(审核、标注、处理)+ 进训练框架训模型 + 模型反馈 +抽象出数据洞察 具身数据乱象:已经出现一些空置的数采场 没有模型需求方牵引,数据采集一定是无序、低效、垃圾场级别的 只有真正在训模型的大脑公司,才有资格定义「需要什么数据」、才能分辨「什么是 garbage」; 「投资人最后看的是这道菜到底怎么样,他并不知道这道菜里头真正用了多少调料。」 具身大脑看美国?中国有机会做出好大脑吗? 中美数据成本差约 10 倍,低成本 + 多样性是中国的机会 关于派(Pi):证明了真实数据在夹爪上能泛化,验证了真实数据路线 现在远没到具身的「ChatGPT 3.5 时刻」:非结构化环境的通用还很漫长,但「专注一个 domain 」的通用是可以做出来的灵初的双模型架构:R 是策略模型(输入图像/语言/本体状态,生成动作);W0 是世界模型(像真实世界仿真器,评估动作后的状态,用强化学习优化、放入约 30% 纠错失误数据),两个模型串成闭环,再回流生成新数据集主流架构(Transformer)能不能成为绝对垄断架构,还需数据验证——Transformer 是在 GPT-3.5 之后吃掉巨量数据、加上强化学习才被验证的;具身底层架构的有效性,同样要靠足够的数据来验证 Part 6. 01:22:54 「游戏才刚刚开始,第一轮淘汰赛都还未开始。」具身大脑公司,怎么做? 大模型&后训练人才:创业公司怎么和大厂抢人? 最难的事怎么解决?——「没有失败过的成功,是不可信的」 为什么拒绝把灵初定位为一家「AGI 公司」? 通用灵巧操作是技术通货:「未来我们甚至可以不做机器人」 AI 时代的产品经理有三个圈——懂技术、懂 UI(用户交互)、有商业思维 从 R(research),到 D(Development),到 P(Product)——如何在一个大组里快速迭代? 选场景必须同时满足两个条件:有真正商业价值的共性痛点(应用面广)、且符合数据泛化性需求 进工厂的事故责任:作为供应商有协议要负责,高节拍流水线很难,流水线下的供料等场景可跑通; 「具身这个行业早已被客户簇拥」 「曲线已开始跑但还没到真正拐点」「今年底是模型泛化性的第一个验证阶段」 基于数据量的模型迭代军备竞赛已开始,周期 3 年以上「百万小时数据是我们最早提的,现在所有人都这么说时反而要警惕」 Part 7. 01:53:30 一个 70 后创业者的务实 & 浪漫创业是冲浪还是西西弗斯:不存在"走到某阶段就彻底释放",过程本身才最重要 「某天清晨阳光斜照在 logo 墙上的一瞬间」 真正的中年危机:40 岁时,最怕未来与自己无关 「我最讨厌被叫老板」 我强烈推荐你去读摩根·豪泽尔的《Same as Ever》 创始人的基因(vision/mission/经历)真正决定了公司的路径 DeepMind 哈萨比斯押注 AlphaGo 做出世界级成果,却 miss 了大语言模型;OpenAI 以"安全/非营利"起家,最后一批人出走创立 Anthropic——同一场 AI 史诗里有各种活法 加入听友群⬇️ 如果你是具身领域的专业 researcher ,欢迎添加主播微信(SJ_Jelyne). 在小宇宙查看该单集文稿

  8. May 25

    74.与地瓜、阿里云的访谈:机器人爆发前夜,工程师成长,与 AI 的第三朵云

    回看历史,人类信息化的每一次范式转移,都有着相似的规律。移动互联网时代的真正到来,并不是因为第一代智能手机的组装下线,而是因为 iOS 和安卓生态的建立、云基础设施的普及,才让千千万万的独立开发者能够以极低的成本创造出改变世界的应用。 开发者成群涌现的前夜,往往是奇点到来的钟声。 今天的嘉宾,正是为这场范式革命加速的具身基建创业者。地瓜机器人的基础设施研发负责人秦玉森,以及阿里云无影事业部总经理张献涛博士。 秦玉森有着 20 多年的机器人开发经验,也是一名成熟的技术管理者 。在这一轮具身革命中,他与地瓜机器人,致力于打造机器人行业的母生态。 张献涛博士则亲历了移动互联网时代,云生态的建立。这期节目中,他清晰地讲述了,云计算,将如何成为撬动整个具身商业社会的超级杠杆。 这期内容不仅包含大量机器人的硬核技术,更是一部关于技术、人才以及基建变迁的微观商业史。 本期嘉宾:秦玉森 - 地瓜机器人的基础设施研发负责人 张献涛 - 阿里云无影事业部总经理 本期 Shownotes:Part 1 . 03:06 机器人之梦 2000 年前后的机器人竞赛 九号收购赛格威机器人之后 北有九号,南有大疆 Part 2. 11:04 工程师的黄金年代 工程师的职业发展启示 & 工程师如何改变世界 技术管理挑战:《人月神话》 从工程师到架构师:认知从线性变立体 Part 3. 22:18 拐点已至:机器人爆发前夜 何为「战略节奏」:需求牵引出结构洞 自动驾驶与具身的人才大战:两个行业的前世今生 大模型降低工程师门槛,晶体智力 & 流体智力 实干家、具身三大派创业与各自的职责 机器人的美在于不完美 Part 4. 35:25 AI 时代的第三朵云:打造机器人的母生态 过去,机器人开发有多难:从重装电脑开始 中国STEM教育领先,小学生玩机器人很常见 什么是机器人的空气、土壤和水? 具身的「重复造轮子」:资源饱和溢出 为什么 Infra 人才特别稀缺? Part 5. 51:27 具身智能融资战 & 场景之战 资本泡沫可以让这个行业快速试错和试对 共识会极速形成 2025 每月的技术进步,快于过去的每一年 工程师培养,从 8 年压缩到3 年 年轻人脑子里的噪音更少,跑得更快 Part 6. 01:10:41 云的变迁 从云计算,到终端智能云计算 阿里云往事:All in 无线,关键一役 机器人时代的第三朵云,长什么样? Part 7. 01:24:02 AI 时代,云架构重构,Agent 与阿里的 TokenHub 什么是 Token 经济?阿里巴巴为什么要组建 Token Hub? 云上输出 token,独立开发者可推动浪潮 当 token 资源不再稀缺,大模型时代爆发期也将过去 Agent 加速机器人自进化,机器人在「做梦中」实现进化 养虾是养一群虾:必须是智能体群协作 Part 8. 前夜:开发者爆发、AI 原生代与利他生态 技术、终端和开发者工具的普惠体系 加入听友群⬇️ 在小宇宙查看该单集文稿

About

更有生命力的科技商业访谈。 Explore better tech reading. Hello~如果是新朋友,推荐几期具代表性的必听节目:1.感受创始人访谈的魅力——第40期(影石JK)、第51期(Plaud许高)、第34期(fellou谢扬);2.感受商业和良知的魅力——第24期医改与集采(必听)、第28期英伟达、第25期聊回购。相信听完这几期,会对这档节目的定位——做最有生命力的科技商业访谈——有更具象的认知。(公众号、各平台视频账号同名) 我是诗婕,做过社会调查、特稿记者、科技媒体主编。关注科技商业进步与公共利益~我会把自己持续学习的过程开源给大家,在这里也能学习AI、具身智能、全球化等前沿领域。在这里,点亮科技星空。 希望一起描绘、定义、推动一个更美好的世界。:) ———— 关于诗婕:虎嗅2024年度作者、金字节奖年度新锐作者、网易非虚构文学奖年度作者、全球真实故事奖TSA(True Story Award)。 合作洽谈 👉 微信:SJ_Jelyne(添加请备注身份+事由) 听友读者互动,欢迎加入听友群(每期节目简介会更新群二维码)

You Might Also Like