5 min read
这个数字应该会重新定义你本季度对 AI 的看法:在 Stanford AI Index 中,AI 智能体独立完成真实的多步骤计算机任务的成功率,从 2025 年的约 20 percent 跃升到了 77.3 percent。在大约一年时间里,软件从大多无法端到端完成工作,变成了在多数情况下能把它做完。对一人公司来说,这不是一条可以远远欣赏的头条新闻。它是一个摆在你办公桌上、等你拍板的决定。
两年来,理解 AI 最有用的思维模型是一位反应飞快、负责答疑的实习生。你提问,它起草,你修改,你发布。这个模型正在悄然过时。如今出现的工具不会等你的下一条指令。它们规划一项任务,在你连接的各个账户之间执行若干步骤,然后把一份成品交到你手上。对一人公司老板而言,真正的战略问题不再是“我该问哪个聊天机器人?”而是“我愿意把哪一部分工作彻底交出去?”
这种转变正体现在软件的定价方式上,而不仅是它能做什么
你能在账单里最清楚地看到这种变化。当一家厂商确信自己的软件能把活儿干完时,它就不再按席位向你收费,而是开始按结果收费。2026 年 5 月,Zendesk 发布了它所称的自主服务队伍(Autonomous Service Workforce),这是一套客服智能体,定价不是按人类用户人头计费,而是按软件实际解决的工单计费。业界对此次发布的报道说得很直白:正如 CMSWire 所报道的,这些智能体是按解决量计费,而不是按席位。
请留意这种定价所承认的事实。只有当一家公司相信工作能在无人介入的情况下完成时,它才会把自己的收入押在结果上。这种信心正在客服、排期、记账和调研工具中蔓延,才是真正的信号。演示一向令人印象深刻。而定价,才是难以造假的那一部分。
这与我们刚刚走过的那个时代是一次真正的断裂,那时争论的还是模型升级和月费。如果你一直在关注这条线索,它就直接连着我们此前谈过的两个转变:从固定订阅转向按用量计量的定价,以及不断追逐最新模型的诱惑,我们此前认为那对一人公司老板来说基本是个陷阱。按结果定价,正是这两条线索的落脚点。
采用几乎已普及,但信任却在朝反方向走
这里有厂商较少提及的一部分。在 2026 年的各类行业调查中,多数较大型组织都表示已在生产环境中运行 AI 智能体,这项技术如今被视为主流,而非试验性质。然而在同一时间段内,人们对完全自主智能体的信心,在一项被广泛引用的调查中,一年内从 43 percent 跌到了 27 percent。采用率上升了。信任却下降了。
这并不矛盾。当人们真正使用一件工具,而不是观看它的演示时,就会出现这种情况。一个替你订会议的智能体很棒,直到它把一位客户的时间订重了。一个回复客服工单的智能体是份厚礼,直到它信心满满地告诉客户一件错误的事。“能把任务做完”和“能被信任在无人监督下把任务做完”之间的差距,恰恰是一人公司老板必须管理的差距。除了你,没有任何人站在智能体和你的客户之间。
你或许会合理地反驳说,这些数据来自有 IT 部门的大公司,跟一人生意毫无关系。这是个公允的观点,而它的意味与初听时恰好相反。大公司可以把一个糟糕的自动化决策消化在层层流程和审核之中。你不能。当你就是整个公司时,智能体一封自信却错误的邮件,会径直发到那个替你付房租的人手里。这恰恰说明,“彻底交出去”这个决定对你更重要,而不是更不重要。每次犯错的代价更高,所以关于该自动化什么的选择,必须更加精准。
该最先交出什么的测试
所以策略不是“采用智能体”或“回避智能体”。它是一道分拣题。把你一周里每一项重复性任务都过一遍下面这三个问题,只把三个都通过的那些交出去。
这项任务可逆吗?如果智能体做错了,你能不能在五分钟内修好、且不留下持久的伤害?起草一份提案的初稿是可逆的。发出一份签好字的合同则不是。从可逆的工作开始。
就算错了,代价也很低吗?把收件箱分类归档是宽容的。以你的名义回复你最大的客户则不是。决定什么先交出去的,应该是犯错的代价,而不是省下的时间。
你能快速核对产出吗?一个生成短清单、你三十秒就能扫完的智能体,可以放心倚靠。一个你得整个重做一遍才能核实其工作的智能体,则没帮你省下任何东西。如果核对它的时间和自己做一样久,那就继续自己做。
三个都通过的任务,比如分类打标签、写初稿、调研摘要、会议纪要、日常数据录入,正是这种新自主性能几乎毫无副作用地发挥价值的地方。哪怕只有一个不通过的任务,比如任何要动钱、做出承诺或以你的口吻对客户说话的事,都要拴短绳:智能体起草,你审核,你发送。如果你对“会动手做事而非答疑的智能体”这个底层概念还不熟悉,我们这份写给一人公司老板的大白话 AI 智能体指南是最好的起点,而关于为什么现在正是行动时机的更完整论述,就在我们探讨多数小企业已经在用 AI 的那篇文章里。
接下来 90 天该实际做什么
挑一项三个问题都通过的任务,把它彻底交出去两周。不是“辅助”,而是完全托付,由你每天核对产出。看看它有多经常是对的。如果它达到 90 percent,就留着它,再加一项。如果没达到,你也用很低的成本学到了东西:这项任务还没准备好,或者你需要一个更合适的工具。无论哪种,你现在都是从自己的生意里得出结论,而不是从一份调查里。
未来一年会跑在前面的老板,不是那些拥有最新模型或最庞大工具栈的人。而是那些一项一项任务地弄清楚、究竟在哪里该信任机器、在哪里该把手按住的人。技术在今年跨过了“它能不能把活儿干完”这条线。决定让它去干完什么,是只有你才能做的工作。
你一周里最先愿意交出去的是哪项任务,又有哪一项你永远不会让它离开你的视线?那条界线,就是你真正的 AI 策略。



