资讯动态

千问上车,“人车合一”的另一种境界

发布时间:2026/10/3 12:27:33 来源:尧图企业网站定制
作者高飞记得有那么几年CES被叫做“披着科技展外衣的车展”汽车厂商扎堆儿在拉斯维加斯发布概念车汽车技术成了消费电子展上最大的展区面积一年翻一倍。风水轮流转。2026年北京车展38万平方米、首发新车181台、展车总数超过1400台规模跃居全球车展首位。但具体看每一个展台会发现AI才是主角端到端大模型、L3量产落地、舱驾融合、车载智能体早代替了马力、扭矩和百公里加速。几乎每家车企都在讲自己的AI方案合资品牌也都在拼命补智能化的课。在这些变化的底层阿里云扮演了一个非常重要的角色。过去一年阿里云全栈AI云支撑全部中国车企智能化落地和全球化升级。60%中国智能驾驶AI算力跑在阿里云上。算力和基础设施看似在底层但直接决定AI的性能上限和功能边界也就直接了解车主的驾乘感知。如今两个汽车领域的老词就在AI的加持下呈现出新的内涵。一个是“人车合一”一个是“第三空间”。具体的感知可以从车展上的一个关键词说起千问上车。一句话办到底千问上车是阿里云在这次车展上主打的IP。千问App这个名字大家不陌生它是阿里巴巴面向C端用户的移动AI助手APP服务超过3亿用户。但车里的千问和手机上的千问有相同也有所不同。相同之处底层都有千问大模型家族的承载不同之处在于千问上车是两股力量的组合一是千问智能体它是为座舱场景重新设计的云端AI助手能理解意图、调用服务、替你办事二是千问大模型它不仅在云端支撑智能体的推理更以Qwen-Omni的形态部署在端侧让车本身具备感知物理世界的能力。二者联手才能实现接下来我们要讲的新“人车合一”。我们拿车里最常见的场景导航来举个例子。大家知道曾经的导航其实更像是地图的加强版在A点和B点之间画线。但实际上车辆的路径源自于乘客的需求。这些需求往往是模糊和不确定的并非两点之间直线最短。比如一种典型的需求是 “一会去亮马河找个离上船码头最近的餐厅吃个饭然后去三里屯太古里但不想排队进地库需要导航到附近的停车场”。这一系列想法人类司机自然是能理解的但传统汽车导航就无能为力。我们只能手动将一个个地理坐标先后录入到导航App中。但千问智能体现在已经能做到对这种模糊需求的精确理解了。对于用户一口气说完的复杂需求智能体可以把里面的四五个地点、偏好和约束条件全部解析导航规划一次性完成。即使开到一半想加个途经点也是说一句补充就行导航直接在当前路线上插入新地点不用重启。如果说导航是让车驶到某个坐标用户实际上想要的是要在这个地理位置实现的某种需求比如导航版去咖啡馆不是目的喝一杯咖啡才是目的。那么更进一步智能体还能完成下一棒的接力因为千问智能体可以调用购物技能。具体来说淘宝闪购能在云端完成定位、商家筛选、商品匹配、生成订单再交由支付宝识别用户声纹完成扣款。全程用户不用掏手机不用跳到别的APP。从意图到执行到支付一整套都在车端的千问智能体里面闭环了。阿里云还引入了一个“有屏无操作”的设计逻辑。因为行车中人最稀缺的两种资源是注意力和双手传统APP那套弹卡片、手指点选、跳转支付的逻辑直接搬进汽车的智能座舱中是行不通的。语音在这个场景里不是更好的选项而是唯一的选项。“有屏无操作”意味着用户只要对着屏幕说话就可以了。所以我们过去说人车合一说的是驾驶者踩油门车就走、打方向车就转是肌肉和机械之间的默契。现在这种“你说车就办”其实也是一种合一只是从脚和手换成了语言和脑。物理世界加数字世界一般来说用户端的操作越简单背后的架构设计就越复杂技术含量越高。千问智能体也不例外它由车内端侧的物理智能和云上的数字智能组合而成。阿里云智能集团AI汽车行业总经理李强最近在智能电动汽车发展高层论坛2026上对这套架构做了非常清晰的表述端侧处理物理世界的交互需求云端通过千问智能体承载数字世界的能力。物理世界加数字世界合在一起才是座舱的完整服务版图。先说物理世界这端。千问上车在端侧的核心是千问大模型家族的Qwen-Omni李强称之为“三进两出”的模型架构。这是千问系列中专门面向多模态感知的分支今年三月底刚发布能同时处理语音、图像、视频三种输入。它的工作不只是听你说了什么语义层面的理解交给云端的大模型也行端侧真正不可替代的能力是感知物理世界。乘客的表情、语气、情绪是疲惫还是兴奋当我们说“找个安静的地方”到底是想去图书馆还是咖啡馆这些非语义信号只有在车里、靠近用户的端侧模型才能捕捉到。除了感知端侧模型还有调度责任哪些是端侧的工作哪些需要云端的配合。显然当我们说“打开车窗”端侧直接就能下发指令闭环。当我们讲一段模糊的导航意图端侧判断之后就需要交给云端去搜索和推理。要做到这个调度过程对用户的无感非常考验端侧模型的响应速度和资源分配能力。但这里面有一个关系容易被忽略端侧是一个根本。李强也讲过一个极限场景弱网环境下的体验保障。隧道里、地库里、信号差的山路上云端可能断了但端侧的基本交互不能中断“在保障用户隐私与安全的同时必须确保在弱网环境下依然能处理物理世界的交互需求”。另外端侧感知如果不准云端给出的服务就全部失配。打个比方端侧像一位贴身管家。如果管家翻译错了后面会全错。因此端侧模型的质量决定了整个体验链条的下限。数字世界那端就是云端决定了智能座舱体验的上限。云端除了更大尺寸的模型推理和意图理解还有一个不可或缺的能力拼图是阿里的生态服务。前面说的淘宝闪购、支付宝声纹支付都是云端在接到端侧传过来的意图之后完成的生态组合拳。以前我们讲“人车合一”更多是人如何去理解车实现更完美的驾驶现在我们讲“人车合一”更多是车如何更好理解人交付更完美的体验。一半是Hermes一半是OpenClaw在和阿里云座舱的相关专家交流之后我发现这套体系似乎还可以用今年AI圈最火的两个开源项目来类比。一个是OpenClaw一个是Hermes Agent。我们先说后者。Nous Research今年二月发布了Hermes Agent两个月内GitHub星标突破九万是2026年增长最快的AI Agent框架之一。它跟其他Agent框架最大的区别在于一个闭环学习机制Hermes解决一个问题之后会自动把解决过程沉淀为一个可复用的skill下次遇到类似问题直接调用。根据Nous Research的内部测试积累了20个以上自建skill的Hermes Agent完成同类研究任务的效率比全新实例快40%。越用越强。千问座舱其实也有类似的逻辑。它通过持续对话学习车主画像你喜欢安静的咖啡馆你习惯走某条路你下午三点左右总想买杯奶茶这些信息沉淀下来之后系统给出的建议会越来越贴合你。这和早期的RAG知识库有本质的区别。RAG式的“懂”是查询匹配我们现在所说的“懂”是行为进化系统理解了用户的偏好模式和意图习惯主动调整自己的行为逻辑。千问座舱走的是后者这条路。我们再来说OpenClaw也就是龙虾。这个大家就更熟悉了。Peter Steinberger去年底发布的这个项目短短几个月拿下超过三十万GitHub星标。如果说Hermes Agent的特征是进化OpenClaw的核心能力在于连接它用标准化协议和内置skill把各种平台、各种服务串联起来。显然这个生态越大、接入越多能办的事就越多。某种程度上如果不是OpenClaw在前边的Skills开路也就没有之后Hermes Agent的接力爆火。无独有偶生态性在千问上车的过程中也充分体现了优势。阿里生态上的高德、淘宝、支付宝都已通过标准化接口接进千问智能体未来还会更多。集团在各业务领域的广泛生态布局使得这种连接优势在不同场景中都能发挥作用——生态越丰富、结合越广泛带来的价值就越大。车企接入千问智能体等于接入了这整张生态网络。忘了车的存在2026北京车展开幕首日长安、东风、北汽、比亚迪、吉利、长城、理想、上汽大众、上汽智己均宣布接入千问。3月份一汽红旗率先宣布接入千问在车内可实现多模糊意图识别与复杂路径规划的服务闭环4月份广汽集团宣布接入千问后座舱具备了极强的逻辑理解与长文本处理能力并融入阿里巴巴“吃、住、行、游、购、娱”全生态实现“一次指令、全部搞定”。实现这个成果背后原因或许是单一维度的领先容易实现但“自进化的深度”乘以“生态接入的广度”这个乘积才构成真正的壁垒。如我们在前边所讲阿里在两端都有积累千问APP的3亿用户沉淀了海量意图理解数据集团的生态提供了国内最完整的生活服务矩阵。当车里能做的事越来越多点外卖、买咖啡、查药店、订酒店它就不再只是一个出行工具了它开始像一个你能在其中工作和生活的空间。其实行业已经喊了好几年“第三空间”但过去这个词约等于座舱里能聊天。加个大屏加个语音助手能讲笑话能播歌。但那不是空间而是一个带轮子的音箱。车里真的能办事了“第三空间”才开始有了更实质的意义。毕竟我们在第一空间和第二空间是要真做事真享受生活的。对了最后说一个很巧合的事情。“人车合一”和“第三空间”这两个词都诞生在1989年。那一年美国社会学家Ray Oldenburg出版了《The Great Good Place》把咖啡馆和公园定义为家和办公室之外的第三空间后来星巴克拿着这个概念做成了一门生意。同一年马自达第一代MX-5的设计师说了一句后来被引用了无数次的话“有那么一瞬间我忘记了车的存在我想这就是人车合一。”37年后这两句话都有了另一层意思并且融为一体。在千问坐进副驾车能替你办事、能读你的状态、能越用越懂你的时候你也会忘记车的存在。只不过这一次你忘记的不是操控的边界而是“车”这个概念本身。因为它不再只是一辆车了它变成了你的第三个生活空间。

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价 →
↑