无界方舟公司推出ArkModel2.0大模型,实现音视频多模态实时互动,延迟低至300毫秒,具备情绪表达和随时打断能力,可驱动虚拟形象与实体硬件,部分能力超越GPT-4o。该模型已对外开放,聚焦教育、智能玩具、车企陪伴等AI陪伴场景。
今年9月的外滩大会上,有一个叫“阿奇”的AI陪伴机器人成了真正的明星。在“未来客厅”展厅里,孩子们围着它里三层外三层,一遍遍喊着它的名字,小手不停地摩挲展台边缘。能让小朋友如此着迷,说到底,还是体验够流畅。

长期稳定更新的攒劲资源: >>>点此立即查看<<<
别看它是个AI机器人,但情商在线、反应灵敏,还能“看见”你。和它聊天,感觉跟真人交流没什么两样,完全没有过去那种生硬、卡顿的机器感。这背后,是它搭载的带有音视频多模态能力的无界方舟大模型——ArkModel 2.0。

正好对比一下。今年国庆前,GPT-4o的高级语音功能终于上线,市场期待已久。但实际情况是,不仅免费用户没法用,即使开放给付费用户,限制也一大堆:没有视频对话能力、每分钟成本高达7块钱软妹币、不能定制音色、偶尔还会出现语音幻觉。反观无界方舟大模型,已经在体验上实现了GPT-4o那种极低延迟的音视频互动效果。不仅能看到人、有情绪地快速回复,甚至在一些方面还走到了GPT-4o前面——它能驱动3D虚拟形象,还能控制实体机器人的动作。这就不只是聊聊天那么简单了。
那么,藏在背后的研发团队,到底是什么来头?
这支团队来自一家成立仅一年的公司——无界方舟智能技术有限公司,创始人兼CEO曾晓东博士,是NLP自然语言处理领域的资深专家,在这个赛道上有超过15年的积累。他不仅是阿里巴巴第一代机器翻译系统的核心算法科学家,也是蚂蚁技术实验室的联合创始人。这里有个小插曲:2017年,曾晓东博士在蚂蚁集团时就已入选了《麻省理工科技评论》评选的“35岁以下科技创新35人”——也就是MIT TR35。今年,月之暗面的创始人杨植麟也同样是这个榜单的入选者。

团队其他成员也来自国内外大厂的AI业务一线,80%的技术人员是NLP方向的博士。产品设计负责人更是拿过红点奖、IF奖等国际大奖的资深专家。一帮高手下场,出手自然不凡。
别看公司才一年多,拿的奖已经不少了。今年WAIC期间,无界方舟在全球200多家顶级AI企业中杀入决赛,最终拿到全球第5的成绩。紧接着,还入选了“2024胡润未来之星潜力企业榜”200强。

那么大模型的产品力到底怎样?答案是,真到了让人眼前一亮的地步。到了ArkModel 2.0版本,它已经实现了一套综合能力:极低延迟、音视频多模态、情绪表达、支持多语言,还能驱动软硬件。就像桌面机器人阿奇演示的那样——给老人读药品说明书、陪孩子聊天,顺畅得不像AI。
GPT-4o掀起的端到端实时多模态热潮,几乎让所有大模型厂商都跟了进来。但实话实说,大部分产品都还处于“半成品”阶段。要同时实现极低延时、随时打断、能看到用户、还能有情绪表达,这些技术难点很多大厂也没完全搞定。甚至很多厂商至今无法提供API或SDK对接服务。
有业内人士说得直白:大厂更愿意摘通用模型里那些“低垂的果实”——ASR语音识别、LLM语言模型、TTS语音合成。但创业公司要想有存在感,就必须在垂直场景里实现通用模型的技术突破。如果说大厂的目标是让木桶没有短板,那么无界方舟要做的是成为一块长板,一块别人用得上的“砖”。
实际体验也印证了这一点。无界方舟大模型真正做到了音视频多模态互动,反馈超低延迟,还能带情绪、带个性地说出来。上手几乎零成本,只要你会说话,就能丝滑沟通。
为了更直观地展示它的能力,我们整理了一张图:

ArkModel 2.0是一个真正的多模态端到端模型,能够同时处理文本、音频和图像。它通过Audio Encoder和Image Encoder分别编码不同形式的输入,在模型中统一处理,然后实时流式输出文本或语音——整个过程行云流水。

这个模型最突出的特点是端到端优化,直接从输入到输出全流程学习。其中合成数据是关键——通过从图片或语音生成文字和语音、从语音生成文本等多种数据增强方式,大大提升了模型的泛化能力和任务适应性。
在多项多模态评测中,无界方舟大模型都超越了GPT-4o等业界标杆:




具体来说,无界方舟大模型有五个明显优势(以下视频均为实拍,无后期处理):
2013年上映的科幻电影《HER》曾把人类与人工智能相爱的故事搬上大银幕,在当时看起来有些疯狂。但随着大模型的出现,这个想法正在一步步变成现实。今年8月,GPT-4o语音功能第一次亮相,就有不少人惊呼:HER来了。首批试用的用户确实体验到了真人对话般的感觉——极低延迟、随时打断、情绪丰富。但随后市场就陷入了沉寂。一位行业专家坦言:只要类GPT-4o的技术没有达到人人可用的状态,市场离真正意义上的爆发还很遥远。
曾晓东博士在外滩大会上分享过对AI Agent商业化落地的一些思考:那些能深层次理解用户需求的个性化智能体,才是AI真正走进千家万户的关键。在用户眼中,它可以是一个智能音箱、一个会说话的潮玩娃娃、一个能和孩子互动玩具狗,或者是一个车载陪伴机器人。无界方舟想做的,正是覆盖这些丰富场景。目前,其大模型不仅对齐了GPT-4o的交互能力,还开发出了独特的优势——在保持极低延迟音视频交互的同时,可以实时驱动虚拟形象和实体硬件的动作。这意味着,它在具身智能、虚拟数字人、IP形象场景中的应用会更有想象空间。
无界方舟大模型现已对外开放合作,也是目前业内唯一一家对外提供音视频互动大模型的企业。应用场景主要聚焦在教育互动、智能玩偶、车企陪伴、具身智能、文旅展示等方面。针对儿童、银发族、学生白领等不同用户群体,都有对应的解决方案。
以教育陪伴领域来说,AI正在改变传统教育模式。多家教育公司都在探索通过AI模拟线下真实授课,做超拟人1对1的AI老师。这类产品的优势在于,它不只是辅助学习,而是通过互动引导学生更高效地交流和吸收知识。再比如儿童的早教产品,目前大多数还停留在故事机阶段,除了讲故事、读绘本,更需要一种一问一答的流畅互动——而这对音视频互动的要求极高,恰好是无界方舟大模型的强项。

另一个热门品类是智能玩具。基于上一代AI技术的产品,经常需要按按钮才能对话、反馈延迟严重,难以自然交流,导致用户使用时长短、留存差。在智能玩具市场里,儿童玩具、IP潮玩、明星周边、数字人盒子、虚拟宠物等,和无界方舟大模型都有很好的结合空间。

此外,车企陪伴、具身智能机器人、文旅/企业展示等场景,也可以通过应用无界方舟大模型,全面革新用户的交互体验,带来业务增长。

年初,不少大模型厂商都认为今年是中国AI应用的爆发元年。但实际情况是,受限于模型性能,AI应用进入了瓶颈期,连北美市场的资本也在重新掂量投资AI的性价比。光大证券的一项研究指出,AI Agent才是打破AI应用发展瓶颈的关键,新的Scaling Law、RL+CoT,对于实现能自主规划的AI Agent至关重要。
无界方舟团队是坚定的AI Agent追随者,他们深耕AI Agent技术与产品,走出两条路线:一条是垂直领域(生物制药)的企业级AI Agent,另一条则是陪伴路线的个人AI Agent。
如何真正降低人类使用AI的门槛?通往AGI的核心基础到底是什么?华泰证券的报告认为,GPT-4o已初步具备Agent能力,而AI Agent才是通往AGI的核心基础,能真正革新人机交互方式。事实上,Agent也是大模型边际变化中最大的能力增量。
每个冲进人工智能领域的创业者,大概都有一个用AI改变世界的梦。但所有梦想都必须落地,才能真正被点亮——既要仰望星空,也要脚踏实地。无界方舟特别的地方就在这里。他们因理想从大厂出来,走出舒适区,进入一个竞争激烈但可能性无限的赛道。曾晓东博士有个更远的梦想,想在生命科学、人类事业上有所建树。一位合作伙伴评价:“他想用他擅长的AI,为人类事业做些贡献。所以当这波AI热潮来了,他毅然决然地出来创业。”眼下,大模型赛道的角逐已经进入深水区,只有真正的价值创造者,才能走到终局。
侠游戏发布此文仅为了传递信息,不代表侠游戏网站认同其观点或证实其描述