云栖大会开幕:AI 终端从“响应指令”转向“感知、判断、执行”
9月22日,2026云栖大会在杭州开幕。大会由杭州市政府与阿里巴巴集团共同主办,以“学以致用”为主题,聚焦Agentic AI(智能体原生AI)。智能体原生,指的是大模型不再只是回答问题,而是接过任务、自己拆解并执行。会场里最直观的变化,是参会者可以带着自己训练的智能体入场。主办方把这种“Agent Native”的参会方式开放给每一个到场的人,同时为AI终端划出一条清晰的路径:从被动响应指令,转向感知、判断、执行。

过去几年,行业的重心几乎都放在“造更强的智”上,参数规模、评测榜单、基准测试轮番刷新,头部模型之间的能力差距也在不断收窄。当基础模型的能力趋于收敛,“能不能造出更强的智能”不再是最紧迫的问题,智能体如何真正走到人身边、被人用起来,就成了讨论最多的话题。这一转向,恰好对应着大会主题里的那个“用”字。
展会现场,多模态情感交互大模型小智AI的展位前人头攒动,参观者们关心的不是模型参数,而是一个更具体的问题:当一台终端开始面对真实的人,一句带着情绪的话、一个含糊的指令,机器能不能接得住。他们反复确认的,其实是同一件事:设备离开演示环境之后,还能不能应付真实对话里的那些不确定。展位上,一批接入大模型的终端设备向观众开放,观众可以对着设备随意开口,看它如何应答。
这套体验的背后,是小智AI的技术底座。多语言识别与情绪识别构成感知层,先听懂人在说什么、带着什么情绪在说;多模态融合构成判断层,把语音、语义与情境放到一起理解;自主反馈构成执行层,让设备自己决定下一步做什么。三层结构对应大会给AI终端划定的路径,也让小智AI覆盖的消费电子、家居、机器人等场景,有了同一套底层逻辑。消费电子要接住随口一句指令,家居要读懂话里的情绪,机器人要支撑设备自主完成动作,三者的要求各不相同,却都压在“感知”这一层上。对一台终端而言,判断和执行决定它能不能把事办成,感知则决定它能不能听懂话里的情绪与弦外之音。后者恰恰是情感交互最难补齐的一块:一句话的情绪常常不落在字面上,而是藏在语气的起伏、语速的变化和措辞的细节里,模型要先读懂这些,才有后面的判断与执行。
这条链条已经有了规模化的注脚。从展位上的交流看,小智AI团队更在意的,是有多少人愿意天天跟它说话。目前,小智 AI 已接入超过200万台设备,日均对话量超过900万条,日消耗Tokens超过2000亿。这些数字拆开看,每一个都对应着一次真实的人机对话。把衡量标准落在“日对话量”而非“装机规模”上,指向同一个判断:智能体的竞争门槛,正在从技术转向场景。设备接入只能说明“能用”,日均对话量才说明“有人用”,两者的差距,正是从能力到场景之间的距离。当模型能力不再是稀缺品,谁离真实使用场景更近,谁就握住了下一阶段的先手。
在云栖大会的语境里,“智以致用”更像一次阶段转换的宣言。“用”字可以拆成两层:能不能用得上,能不能用得好。前者有明确的量化标准,跑分、时延、成本都能算得清楚;后者没有标准答案,只能靠一次次真实对话去逼近。小智AI把答案押在了后者:一台终端能不能被持续使用,取决于它能不能读懂人话里的那点情绪与分寸。比起把参数再往上抬一截,先想清楚使用场景、把“听懂人”这件事做扎实,才是更靠得住的路径。
当智能体开始走到人身边,衡量它的标准正在从“更聪明”转向“更懂人”。云栖大会把“感知”这个命题摆到台面上,也让“能不能听懂真实需求”成为智能体落地的一道新考题。这条赛道的胜负,不会只由参数决定,而会由真实场景里一次次对话的成色决定。
相关阅读
