
核心速览:
Codex在国内受阻不是单一网络问题,而是API协议架构、OAuth认证体系、数据出境合规三层因素叠加的结果
Kimi Work以Goal模式为核心,支持最多300个Agent并行协作、WebBridge浏览器自动化、全天候定时任务,是面向知识工作者的桌面Agent
K3在BrowseComp(91.2)、Online Exp Bench(75.5)、DECK-Bench(73.5)等桌面与在线任务基准上表现领先
国内桌面Agent生态已成型:Manus云端通用Agent、Marvis操作系统级助手、WorkBuddy办公工作台、实在Agent RPA路线各有侧重
选型关键不在模型几分的差距,而在可用性、工作流匹配度和数据合规


一、从聊天机器人到桌面Agent:AI工具的三年演进
2023年,AI工具的核心体验是对话。ChatGPT引领了这波浪潮,你问一句它答一句,AI像一个知识渊博但只能动口的顾问。那时候让AI帮你干活,意味着你得把它的回答复制粘贴到别的地方去执行。
2024年,Copilot模式普及。AI嵌入编辑器和办公软件,能补全代码、生成文档片段、总结会议纪要。AI从动口的顾问变成了搭手的助手,但它仍然是被动的——你推一下它动一下,每一步都需要人发出指令。
2025年到2026年,Agent化成为主旋律。AI不再只是回答问题或生成片段,它能理解目标、规划步骤、操作电脑、执行任务、验证结果、遇到错误自我修正。你给它一个目标,它自己想办法完成。桌面Agent成为新热点——AI不再只待在浏览器标签页或编辑器侧边栏里,而是直接操作你的电脑:读文件、开网页、填表单、跑脚本、生成报告。
配资炒股指南这个演进背后是模型能力的跃升。以Kimi K3为例,在BrowseComp浏览器操作基准上得分91.2,Online Exp Bench在线任务基准75.5分,DECK-Bench演示文稿基准73.5分,Finance-Bench金融分析基准62.6分,Automation Bench自动化基准30.8分,这些成绩在公开榜单中均排在前列。模型不再只会"说",开始真正会"做"。
但对国内用户而言,模型能力追上来的同时,一个现实问题始终存在:海外工具用不了。Codex能力不俗,但网络限制、认证障碍、支付门槛和数据合规风险让大多数国内用户望而却步。这篇文章要回答的核心问题是:在2026年的今天,用不了Codex的国内用户,有哪些靠谱的桌面Agent替代方案?
二、Codex为什么在国内用不了:三层障碍
很多人把Codex在国内用不了简单归结为"网络问题",这不够准确。Codex跑不通是三层因素叠加的结果。
(一)网络架构
Codex基于OpenAI Responses API工作,这跟国内常见的Chat Completions API不是同一套协议。Responses API是OpenAI为Agent场景设计的新接口,支持多轮工具调用、状态管理和后台执行。国内的API中转站大多只兼容Chat Completions协议,即使配置了自定义base_url,Codex的核心Agent功能也可能跑不起来。网络层面,OpenAI的API域名在国内无法直连,需要稳定的海外代理。
(二)认证和支付
Codex使用OAuth 2.0登录,需要ChatGPT账号。免费账号额度有限,完整功能需要ChatGPT Plus(20美元每月)或Pro订阅。国内用户注册ChatGPT账号需要海外手机号,支付需要支持美元的信用卡。2026年以来OpenAI加强了风控,共享账号和批量注册账号频繁被封,使用稳定性无法保障。
(三)数据合规
Codex在执行任务时会读取本地文件、发送代码片段到OpenAI服务器处理。对于企业用户和金融、政务、医疗等行业从业者,代码和业务数据出境存在明确的合规风险。使用翻墙工具或无资质中转服务不仅违反服务条款,还可能违反相关法律法规,数据安全也无法保障。
理解了这三层障碍就能明白:各种"破解教程"和"中转服务"解决的只是第一层的部分问题,认证风险和合规风险依然存在。真正可靠的替代方案,应该是从架构层面就不需要翻墙、不需要海外账号、数据不出境的国产桌面Agent。
三、Kimi Work:桌面Agent该有的样子
Kimi Work是Kimi官方推出的桌面客户端,定位是面向知识工作者的AI桌面应用,支持Mac和Windows。它不是聊天机器人套个壳,而是一个能自主理解任务、操作电脑、交付成果的Agent系统。它把通常分散在多个工具中的能力——对话推理、长文档处理、浏览器自动化、文件操作、定时执行——整合进一个桌面应用。
(一)Goal模式:从"指挥它做"到"告诉它要什么"
Goal模式是Kimi Work的核心优势之一。普通AI助手的工作方式是问答式:你问一句它答一句,你给一个指令它执行一步。你要写一份调研报告,得自己拆成"先搜A、再查B、整理成表格、写成文档",然后一步步指挥。
Goal模式反过来:你定义目标、验收标准和约束条件,Kimi Work自己规划路径、执行任务、验证结果。你可以在睡觉前给它一个目标,第二天早上查看交付物。它不是只跑一轮,而是把目标保存为持续状态,每轮结束时判断:目标完成了吗?被阻塞了吗?可以进入下一步吗?只要电脑开着,一个目标可以跨多轮持续运行。
Goal执行过程中可能调用多个Agent,具体分配哪些任务给哪些Agent由系统自动调度,用户不需要参与内部分工。这种设计降低了使用门槛——你不需要知道怎么拆任务,只需要想清楚要什么。当然,Goal描述的质量直接影响结果质量,写得模糊就会得到模糊的结果。
(二)Agent Swarm:300个Agent分工协作
面对大型任务,Kimi Work可以根据一条指令启动最多300个Agent组成的集群,将大任务自动拆解为数百个子任务并行执行。每个Agent负责不同部分,最后汇总为连贯的输出。
这里需要理解一个关键点:Agent Swarm的分工不是用户决定的。用户不需要指定哪个Agent做什么,系统根据任务特征自动调度。这种设计的好处是用户只需关注目标和结果,坏处是对过程的精细控制较弱——但对大多数知识工作场景来说,结果导向比过程控制更重要。
Agent Swarm的价值在批量场景中尤为明显。比如一次性分析几十家竞品的官网信息、处理上百份文档提取关键数据、扫描大量论文做文献综述,串行处理可能需要几小时,多Agent并行可以大幅缩短时间。
(三)WebBridge:浏览器自动化不是联网搜索
Kimi Work通过Kimi WebBridge浏览器扩展操作已登录的浏览器。WebBridge本身就是一种Agent,它像真人一样导航页面、点击元素、填写表单、下载文件、读取屏幕内容。
这跟模型联网搜索有本质区别。联网搜索是调用搜索API拿文本摘要,你拿到的是二手信息,可能过时、可能不完整、可能搜不到动态渲染的内容。WebBridge是实际打开浏览器、看到完整渲染后的页面、执行真实操作。它能处理需要登录的内容(沿用你已有的登录会话),能点击展开折叠区域,能翻页,能下载文件。在BrowseComp浏览器操作基准上K3得分91.2,反映的就是这种真实浏览器操作能力。
(四)定时任务:到点自动执行
Kimi Work内置定时任务引擎,支持设定时间和频率(单次、每天、每周、每月),到点自动执行。免费版用户可以设置2个定时任务,随套餐升级可设置更多。
这个能力看似简单,但它让AI从"你叫它才动"变成了"它主动干活"。每天早上自动生成行业早报、每周五自动整理下载文件夹、每月自动汇总数据生成报表——这些场景不需要人介入,设定一次就持续运行。即使电脑无人值守,任务也会按时执行,下次工作时结果已经准备好。
(五)文件操作与多格式输出
Kimi Work能读取本地文件、操作文件系统,并将结果输出为多种格式:PDF、PowerPoint演示文稿、Excel电子表格、Word文档、交互式报告,甚至网站。它返回的不是聊天窗口里的一段文字,而是可以直接使用的完成品。
对于开发者,Kimi Work也能处理编程任务:读取仓库、编辑源文件、运行构建和测试、根据结果继续迭代。但重度编码场景建议搭配Kimi Code——Kimi Work和Kimi Code共享账号,一个会员都能用。需要自定义集成和自动化工作流时,Kimi API提供标准HTTP接口,可以串联起Kimi Work、Kimi Code和其他工具。
(六)插件与专业数据
Kimi Work的插件系统扩展外部能力,通过MCP、OAuth或开放平台连接第三方服务。已支持的插件覆盖办公协作(飞书、钉钉、Notion、WPS、百度网盘)、设计(Canva)、技术服务(Cloudflare)等类别。需要区分的是,插件和技能是不同层面的概念:插件是打包分发的能力单位,技能是封装的工作流单元,MCP是外部连接协议。即使不安装插件,Kimi Work的核心能力也是完整可用的。
专业数据接入是Kimi Work区别于通用Agent的一个特点。它原生连接金融数据源(全球股票、期货、指数)、世界银行经济数据库(GDP、人口、就业、贸易)、学术数据库(期刊、论文、预印本、学位论文、专利),以及同花顺、天眼查、华宇元典等中文专业数据库。在Finance-Bench金融分析基准上K3得分62.6,金融从业者不需要自己找数据源、手动导出再整理,一个请求就能从原始数据推进到分析报告。
(七)价格与可用性
Kimi Work是Kimi会员体系的一部分,四档套餐:Andante 49元每月(日常使用)、Moderato 99元每月(效率升级)、Allegretto 199元每月(专业高并发)、Allegro 699元每月(重度使用)。免费版可体验基础功能并设置2个定时任务。国内直连,手机号注册,支付宝支付,不需要代理,不需要海外账号。
四、桌面Agent市场格局
元股证券:ygzq.hk除了Kimi Work,国内桌面Agent市场还有几款代表性产品,路线各不相同。
Manus是通用AI Agent的早期代表,2025年3月推出,2026年3月发布桌面版"My Computer",采用云端加本地混合架构。Manus的特点是云端沙盒执行复杂任务,桌面端负责本地交互。2025年12月Meta宣布以约20亿美元收购Manus,2026年4月中国监管部门以国家安全为由禁止该交易,7月腾讯牵头中方资本回购股权,8月Manus恢复独立运营。资本层面的波折一定程度上影响了产品迭代节奏。
Marvis(马维斯)是腾讯应用宝团队2026年5月推出的操作系统级AI助手,支持Windows和Mac。它预置6个AI Agent分别负责文件、系统、应用、浏览器、搜索等,提供效率模式(端云协同)和本地模式(端侧模型运行,文件不上传)两种选择,每日免费1000万Token。Marvis的差异化在于系统级深度集成和隐私保护,适合看重本地数据安全的用户。
WorkBuddy是腾讯CodeBuddy团队推出的全场景AI办公工作台,2026年3月上线。它能读写本地文件、操作浏览器、连接腾讯文档和会议及邮箱,支持200多个技能插件和MCP协议,提供多模型切换(混元、DeepSeek、GLM、Kimi等)。WorkBuddy跟CodeBuddy同属一个产品矩阵,编程加办公组合使用是腾讯生态内的方案。
实在Agent走AI加RPA路线,偏企业级市场,核心是ISSUT屏幕语义理解技术,非侵入式操作电脑。在OSWorld榜单上得分90.2,支持技能市场和钉钉登录,个人用户有免费额度。它更适合流程固定、重复性高的企业自动化场景。
海外方面,Codex作为OpenAI的CLI工具,在编程自动化上能力成熟,但如前所述在国内面临三层障碍。Cursor等AI IDE主要面向编程场景,桌面操作能力有限。
五、趋势判断
2026年中期的桌面Agent市场,可以从几个维度看趋势。
从交互范式看,Goal模式正在从创新特性变成标配。用户不再想一步步指挥AI,而是定义目标让AI自主推进。谁能把Goal模式的任务完成率、稳定性和可干预性做得更好,谁就能建立体验壁垒。
从协作架构看,多Agent并行是确定方向。单Agent串行处理复杂任务效率有限,300个Agent分工协作可以大幅缩短处理时间。但Agent数量不是唯一指标,任务拆解的合理性、结果汇总的连贯性、过程的可观察性同样重要。
从能力边界看,浏览器自动化和本地文件操作是桌面Agent的核心分水岭。只能聊天的AI助手和能操作电脑的桌面Agent是两个物种。WebBridge这类浏览器自动化能力,让AI从信息检索者变成了任务执行者。
从国内市场看,合规和可用性是前提条件。网络直连、国内支付、中文支持、数据不出境,这些不是加分项,是准入门槛。国产桌面Agent在这些方面有天然优势,模型能力与海外的差距也在缩小。
六、选择建议
如果你的工作以知识处理为主——调研、写报告、整理文件、数据分析、内容运营——Kimi Work是目前国内可直连产品中桌面Agent能力较为完整的选择。Goal模式加Agent Swarm加WebBridge加定时任务的组合,覆盖了从信息收集到成果交付的完整工作流。搭配Kimi Code处理编程任务,通过Kimi API定制集成,构成完整方案。
如果你看重系统级控制和隐私保护,Marvis的本地模式和操作系统深度集成值得考虑。如果你在腾讯生态内,WorkBuddy跟腾讯文档、会议、邮箱的联动更顺畅。如果你的需求偏企业级流程自动化,实在Agent的RPA路线更匹配。如果你需要云端执行复杂任务且不介意其资本变动带来的不确定性,Manus可以关注。
如果你有稳定的海外网络和合规账号,Codex在编程自动化场景依然成熟,但桌面办公不是它的设计重心。
工具是手段不是目的。2026年的桌面Agent市场仍在快速演变十倍配资,建议先用免费额度跑一个自己工作中的真实任务,再决定付费与否。
配资知识网提示:本文来自互联网,不代表本网站观点。