约书亚·斯坦克尔在洛杉矶经营着一家名为Clean Saint的公司,主营免水型口腔护理膜。这家公司实际上只有他一个人。他借助AI处理采购、营销、网站建设和客户服务等事务。当被问及对这种模式的感受时,他这样描述:“从某种意义上说,我现在仿佛拥有了十个分身。”
这句话的后半句耐人寻味:如果你真的拥有十个“分身”,就必须有办法确认另外九个“分身”到底有没有把工作做好。
目前,关于AI的讨论,大多仍聚焦于同一个问题:哪个模型最好?但对企业而言,这并不是合适的衡量标准。模型能做的是逻辑推理,而商业运作涉及给供应商打电话、报关、追查错过船期的集装箱、处理退货等具体环节,这些任务没有一项可以单凭模型独立完成。真正能够完成工作的是AI智能体,它由三部分组成:负责思考的模型;赋予其工具、记忆和行动能力的运行框架;以及让它明白“在特定行业中何为理想结果”的业务场景。在阿里国际站,这种场景认知,源自27年来对全球贸易实际运转的持续沉淀。
真实商业场景对AI智能体提出了哪些要求
如今,AI行业已经非常擅长评估模型的智能水平。各类基准测试涵盖了推理、编程、数学、事实检索,并逐渐延伸至工具调用能力。然而,现实中的商业运作远比这些基准测试所反映的情况繁复得多。单看书面流程,采购任务似乎很简单,但在实际操作中,可能意味着要横向对比数十份报价,找出产品规格书第四页隐藏的前后矛盾之处,仔细审查付款条款,以察觉其中悄然发生的变更,还要确认供应商承诺的交货日期,能够匹配己方的运输计划。
商品信息管理也是同样的道理。商品属性和分类必须准确无误。同一条商品信息,在德国可能需要满足一套合规要求,在美国加州可能又要符合另一套监管规定。在此类场景中,仅仅输出看似合理的内容,几乎毫无价值。任务必须在对应的业务系统中准确无误地完成。
如果仅凭输出的文字来评判AI智能体,无异于只靠笔试成绩考核飞行员,却不检验他们能否驾驶飞机平稳着陆。
以结果为评价标准
正因如此,阿里国际站Accio团队推出面向全球外贸场景的AI智能体,并专门开发了一套以最终结果为评价标准的基准测试。这套名为CommerceAgentBench的测试现已在GitHub开源,其中包含107项端到端任务,均源自真实电商运营场景,涵盖采购、物流、商品发布、履约和售后服务等环节。
这些任务取自我们的自有数据,包括1,000万活跃中小企业用户、160万条真实对话记录和20万条执行轨迹,最终归为七大类商业工作场景。
这套测试按最终状态评分。例如,商品属性无误并顺利上线,则视为通过,反之失败;货物按照实际存在的运输路线运送,才算达标,否则只能滞留在宁波港码头,等待相关人员查清问题所在。
商业世界向来以成败论英雄。如果客户收到错发的商品,那么AI智能体在下单时表达得多么动听,对客户而言都没有意义。唯有执行结果才是真正重要的衡量标准。
测试发现
我们测试的最强前沿模型,任务成功率也仅为61.7%。
这个数字高到足以证明其实用价值,却又低得足以令人警醒。就在不久前,自动化系统还无法胜任多步骤商业任务;如今在大多数情况下,系统已能完成此类任务。但仍有近四成任务会出现差错。
失败案例集中出现在几类典型场景。AI智能体难以发现隐藏在冗长供应商邮件往来中的付款异常,因为这类异常,只有通读全部300封邮件,才会暴露出欺诈的本质。当落地成本的计算同时涉及多个变量时,智能体极易出错。在售后纠纷处理中,如果需要核对相互矛盾的文件,任务就容易失败。此外,多程运输路线的处理,也始终是智能体的薄弱环节。
而上述任何一种情况,在现实商业运营中每天都会发生数千次。
随着智能体应用规模的扩大,风险的性质也会发生变化。当数千家企业运行同类智能体时,原本孤立的个体错误可能演变成联动性风险:错误商品信息可能成倍增加,欺诈风险信号可能被遗漏,运输路线安排或合规方面的差错可能沿着供应链层层扩散。评测能够清晰显示,哪些自动化场景已具备规模化条件,哪些环节仍需要人工同步监督。
相比61.7%的整体任务成功率,另一个测试结果更令我意外:没有任何一个模型能包揽所有任务第一名。不同模型在不同类别的任务中各有优势。有的模型在询报价处理和市场调研方面排名第一,却在索赔处理和商品合规审核任务中被其他模型反超;有的模型则在商品发布和退货处理方面表现最为出色。单纯依靠通用推理能力得分建立的排名,几乎无法预判某个系统在具体商业任务上的表现。正因为如此,模型的选择应当由具体工作任务决定。
精准授权
对一家企业而言,这种宏观风险转化为一个非常务实的问题:相比行业内的最强模型之争,企业真正应该思考的问题要更加具体——究竟有哪些工作流程现在就能放手交给AI智能体,哪些依然需要自己亲自处理?以交付结果为标准的基准测试,恰恰能够回答这个问题。对于通过率较高的任务,如供应商比价和常规商品发布等工作,企业大可交由AI智能体处理。而对于通过率较低的任务,例如特殊的合规问题、复杂的谈判,以及在任何商业运营中占比远超预期的各种例外情况,则应保留人工参与,并对AI的工作结果进行审核。
我把这种做法称为“精准授权”。一旦明确了AI智能体在哪些任务上表现可靠,就可以停止人工持续监督;一旦知道了它容易在哪些环节失灵,就能在客户之前及时发现错误。两者都能帮助企业节省成本,而如果没有评测机制,这一切都无从谈起。
商业领域需要这样的测试,其他行业也是如此。物流、金融、制造业、医疗和法律服务等行业,都有各自特殊的复杂场景。每个行业都需要建立评测基准,其制定者必须真正了解不良结果可能产生的代价,而且基准也应当保持开放,让买方能够据此检验供应商宣称的能力。
权限将逐步移交给AI智能体:每跑完一个工作流程,它才能赢得一份授权。如今,约书亚拥有了十个“分身”。而他接下来需要解决的问题是:在这十个分身中,有哪些已经可以让他彻底放手、无需复核。
本文作者张阔现任阿里巴巴(Alibaba.com)国际站总裁。
Fortune.com上发表的评论文章中表达的观点,仅代表作者本人的观点,不代表《财富》杂志的观点和立场。(财富中文网)
译者:刘进龙
审校:汪皓