资讯动态

Proma:下一代桌面AI Agent中心,整合多模型与工具链,重塑工作流

发布时间:2026/8/4 23:55:38 来源:尧图企业网站定制
1. 项目概述为什么我们需要一个“桌面级”的AI Agent中心如果你和我一样在过去一年里频繁地在ChatGPT、Claude、Gemini以及各种国产大模型之间来回切换同时还得折腾各种Agent工具链比如Cursor的VibeCoding、Claude Desktop的MCP那你一定深有体会我们的工作流正在被割裂。写代码时用Cursor处理文档时切到Claude需要联网搜索又得打开另一个网页。更别提那些需要多步骤协作的复杂任务比如“帮我分析这份财报PDF总结要点然后生成一份中文简报最后用邮件发出去”——这往往意味着你要手动在四五个窗口和工具间传递信息效率低下不说上下文还容易丢失。Proma的出现正是为了解决这个痛点。它不是一个简单的“聚合聊天客户端”而是一个定位为“下一代集成通用Agent的AI桌面应用”。简单说它想成为你电脑桌面上那个唯一的、功能强大的AI指挥中心。它的核心设计哲学是“本地优先”和“多供应商支持”。所有对话历史、记忆数据、配置文件都安静地躺在你的~/.proma/目录下用最朴素的JSON和JSONL格式存储没有云端数据库没有隐私泄露的担忧你可以随时打包带走。同时它几乎接入了所有你能叫得出名字的主流和国产大模型让你可以根据任务需求、成本预算和响应速度自由地切换“大脑”。对我而言Proma最吸引人的是它试图将“对话”、“单Agent执行”和“多Agent团队协作”这三种能力无缝整合在一个应用里。你可以把它当作一个高级版的ChatGPT Plus来日常聊天、处理文档当你需要一个能自主调用工具比如搜索、读写文件、执行代码的智能体时可以一键切换到Agent模式而面对更复杂的项目时则可以启动Agent Teams让多个各司其职的AI智能体像一支小分队一样协同工作。更酷的是通过飞书机器人你可以把这只AI小分队“带出”桌面在手机上和同事的群聊里继续指挥它们干活。这已经超越了一个工具的概念更像是在构建一个以你为中心的、可扩展的AI工作环境。2. 核心能力深度解析不止于聊天2.1 多模型对话不仅仅是“聚合”很多聚合工具只是做了个UI壳子背后调用不同API而已。Proma在Chat模式下的价值在于其“一致性体验”。无论你背后切换的是Anthropic的Claude、OpenAI的GPT-4o、Google的Gemini 2.0 Flash还是国内的DeepSeek、Kimi、智谱GLM你面对的交互界面、文件上传处理、对话历史管理、乃至Markdown和图表渲染都是统一的。这极大地降低了心智负担。注意不同模型对上下文长度、文件格式的支持、以及提示词Prompt的敏感度差异很大。例如Kimi以超长上下文见长适合处理整本书或大量文档而Claude在逻辑推理和遵循复杂指令方面表现更优。在Proma中灵活切换模型本质上是根据当前任务选择最合适的“处理器”。2.2 Agent模式从“对话”到“执行”这是Proma区别于普通聊天客户端的核心。其Agent能力基于Anthropic官方发布的Claude Agent SDK构建。当你启用Agent模式时AI不再仅仅是和你对话它获得了“行动”的权限。这背后是一套复杂的架构规划与思考AI会先理解你的指令将其分解为可执行的子任务。工具调用根据子任务动态选择并调用已注册的工具Skills MCP。例如你让它“查一下今天北京的天气然后总结成邮件”它会先调用一个网络搜索工具再调用一个文本总结工具。执行与观察工具执行后返回结果AI观察结果并决定下一步是继续调用工具还是将最终结果呈现给你。Proma的优雅之处在于它通过“思考模式”将这个黑盒过程可视化。你能看到AI的思考链Chain of Thought了解它为什么选择某个工具工具返回了什么。这对于调试复杂指令、建立对AI的信任至关重要。实操心得Agent模式对模型能力要求极高。官方推荐使用Claude 3.5 Sonnet或Opus因为它们的工具调用准确性和规划能力最强。虽然Proma也支持将MiniMax、Kimi等国内模型的端点映射为Anthropic格式来使用Agent但实际效果和稳定性与原生Claude API仍有差距。对于关键的生产力任务建议优先使用Claude系列模型。2.3 Agent Teams复杂任务的“蜂群”解决方案当单个Agent搞不定时就该Agent Teams出场了。你可以把它理解为AI界的“特种兵小队”。Proma可以根据你任务的复杂度自动组建一个团队。例如一个“市场调研”任务可能会被拆解给研究员Agent负责搜索和收集信息。分析师Agent负责整理数据提炼观点。撰稿人Agent负责将分析结果润色成报告。这些Agent会并行或按流程协作共同完成任务。根据项目方的测试这能将复杂任务的处理效果提升5%-20%。更重要的是你可以在右侧面板实时看到每个Agent的工作状态和中间输出对整个流程有完全的掌控感。2.4 Skills MCP无限扩展的工具箱Skills和MCP是Agent能力的来源。你可以把它们理解为给AI安装的“小程序”或“插件”。Skills通常是Proma应用内集成的、功能相对独立的小工具比如内置的“头脑风暴”和“办公软件”技能。MCP这是Claude提出的“模型上下文协议”它是一种标准化的协议允许外部服务器可以是本地进程也可以是远程服务向AI模型暴露一系列工具。Proma支持MCP意味着它的工具生态是开放的。未来开发者可以为Proma开发各种MCP服务器让它能操作你的数据库、控制你的智能家居甚至管理你的服务器集群。Proma支持通过对话自动寻找和安装Skills这降低了使用门槛。但对于MCP目前还需要一定的技术能力进行手动配置这也是高阶玩家可以深度定制的地方。2.5 飞书远程集成打破设备与场景的壁垒这是Proma一个极具创新性的功能。通过配置一个飞书机器人你将桌面端强大的Agent能力延伸到了移动场景和协作场景。私聊机器人相当于你有了一个24小时在线的AI私人助理。在通勤路上用手机发条指令“帮我查一下明天上午10点后第一个可预约的牙医时间用我的日历格式整理好发回给我。” Agent会在你电脑上自动完成查询、整理并将结果通过飞书发回给你。群组机器人将Proma Agent拉入工作群。当同事在群里问“这个季度的销售数据对比分析谁有”你可以机器人并附上数据文件让它直接生成分析图表和结论发到群里。这实现了真正的人与AI、人与人之间的混合协作。避坑指南飞书机器人配置涉及创建企业自建应用、获取App ID和Secret、配置事件订阅与权限、设置加密密钥等步骤。虽然官方说“3分钟搞定”但对于不熟悉飞书开放平台的新手第一次配置可能遇到回调地址验证失败、权限不足等问题。建议严格按照教程操作并确保你使用的飞书账号有创建应用的权限通常是团队管理员。配置成功后这个功能的价值远超所花费的时间。2.6 记忆功能让AI真正“认识”你记忆功能是让AI从“工具”迈向“伙伴”的关键一步。Proma的记忆是跨Chat和Agent模式共享的。它不仅仅记住对话历史更重要的是能从中提取并存储关于你的“偏好”、“习惯”和“事实”。偏好你经常让AI用哪种风格写作正式还是幽默习惯你通常喜欢让AI把总结输出成要点列表还是段落事实你的职业是前端工程师常用技术栈是React和TypeScript。当AI拥有了这些记忆它对你的理解就有了连续性。下次你简单地说“用老风格写个周报”它就知道你指的是“用Markdown格式分‘已完成’、‘进行中’、‘下周计划’三个板块每个项目附带简要说明”的这种风格。这极大地减少了重复描述需求的沟通成本。3. 从零开始安装、配置与核心功能实操3.1 环境准备与安装Proma是一个桌面应用目前提供了Windows、macOS和Linux的安装包。安装过程非常简单从GitHub Releases页面下载对应系统的安装文件.dmg, .exe, .AppImage等像安装普通软件一样完成即可。安装完成后首次启动你会看到一个干净清爽的界面。左侧是会话列表中间是主对话区域右侧是设置和扩展面板如记忆管理、Agent Teams状态。3.2 核心配置添加你的第一个AI“大脑”没有配置模型的Proma只是一个空壳。点击左下角的设置图标进入“渠道管理”。添加渠道点击“添加渠道”你会看到一个长长的供应商列表。选择你拥有API Key的服务商比如“OpenAI”。填写信息名称给你这个配置起个名字如“我的GPT-4”。API Key填入你在OpenAI平台获取的密钥。务必妥善保管Proma会将其加密后存储在本地。Base URL对于OpenAI官方这里会自动填充为https://api.openai.com/v1。如果你使用第三方代理或兼容API如OpenRouter、LiteLLM等需要修改为此类服务的地址。测试与获取模型点击“测试连接”如果成功下方会显示绿色提示。接着点击“获取模型”Proma会向该API地址请求可用的模型列表并下拉展示如gpt-4o,gpt-4o-mini等。选择你想默认使用的模型。重复上述步骤为你常用的其他模型如Claude、Gemini、DeepSeek添加渠道。Proma支持同时配置多个渠道并在对话中随时切换。国内模型特殊配置表 对于MiniMax、KimiMoonshot、智谱GLM它们为兼容Anthropic Agent SDK提供了专用端点。在Proma中添加时选择对应供应商后Base URL会自动填充正确。你需要确保你的账户有相应的API访问权限通常是平台的“编程会员”或“开发者套餐”。供应商在Proma中选择Chat模式API端点 (自动填充)Agent模式所需端点 (自动映射)关键点MiniMaxMiniMaxhttps://api.minimaxi.com/v1https://api.minimaxi.com/anthropic需开通MiniMax Pro会员获取API Key。Kimi (Moonshot)Moonshothttps://api.moonshot.cn/v1https://api.moonshot.cn/anthropic需在Moonshot平台购买“开发者套餐”。智谱GLMZhipu GLMhttps://open.bigmodel.cn/api/paas/v4https://open.bigmodel.cn/api/anthropic需在智谱平台创建应用并获取API Key。3.3 开启Agent能力前提确保你已成功添加并测试通过一个Anthropic渠道因为Agent SDK由Anthropic提供。设置进入“设置” “Agent”选项卡。选择在“Agent渠道”下拉框中选择你配置好的Anthropic渠道例如“我的Claude”。在“Agent模型”中选择一个模型强烈推荐claude-3-5-sonnet-20241022或claude-3-opus-20240229它们在工具调用和复杂任务处理上表现最佳。切换模式配置完成后在主界面左上角或输入框附近你会发现一个模式切换开关可以从“Chat”切换到“Agent”。切换后输入框的提示语可能会变化表示AI现在可以执行任务了。3.4 实战完成一个多步骤的Agent任务让我们用一个实际例子串联起上述功能。假设任务“请帮我分析当前项目根目录下README.md文件的主要内容然后根据内容搜索最新的‘React状态管理’趋势文章最后将两份内容合并生成一份给团队的技术分享提纲。”准备确保处于Agent模式并且已为Agent配置了Claude Sonnet模型。同时确保Skills中包含了文件读取和网络搜索相关的工具Proma可能内置或需要你通过MCP配置。输入指令将上述任务描述完整地输入到对话框中。观察思考过程AI不会立刻输出答案。你会看到它进入“思考模式”可能会显示思考用户指令包含三个连续任务1. 分析本地文件。2. 基于分析结果进行网络搜索。3. 合并信息生成提纲。我需要按顺序执行。行动调用‘read_file’工具参数{path: ./README.md}观察文件读取成功内容为...思考从README中提取到关键词‘React’, ‘前端’, ‘状态管理’。现在执行第二步搜索。行动调用‘web_search’工具参数{query: React状态管理 2024 趋势 最新文章}观察搜索返回了5条结果分别是......后续合并与生成步骤获取结果最终AI会输出一份结构清晰的Markdown格式技术分享提纲并可能附上搜索到的参考链接。在这个过程中你无需手动切换工具或复制粘贴内容。AI作为代理自主完成了整个工作流。如果任务极其复杂你可能会看到它自动启用了Agent Teams分配不同的子任务给不同的“虚拟专家”。3.5 配置飞书机器人实现远程操控这是将Proma能力“移动化”和“协同化”的关键一步。在飞书开放平台创建应用访问 飞书开放平台 用你的飞书账号登录需有创建应用权限。点击“创建企业自建应用”填写应用名称如“我的Proma助手”、描述并上传图标。获取凭证在应用详情页找到“凭证与基础信息”部分。记录下App ID和App Secret。这是Proma与飞书通信的“账号密码”。配置事件订阅在左侧找到“事件订阅”。在“请求地址”中你需要填写一个公网可访问的URL。这对于个人用户是个门槛。解决方案如果你有云服务器可以自己部署一个简单的转发服务。更简单的方法是使用内网穿透工具如ngrok、localtunnel。在本地运行ngrok http 3000假设Proma的飞书服务端口是3000它会生成一个临时的公网地址如https://abc123.ngrok.io将这个地址填入“请求地址”。“加密密钥”和“验证令牌”可以随机生成并记录在Proma配置中需要用到。在“订阅事件”中至少需要订阅“接收消息”相关的事件如im.message.receive_v1。配置权限在“权限管理”中为应用添加以下权限contact:user.id:readonly获取用户ID、im:message发送和接收消息、im:message.group_at_msg:readonly接收群消息等。根据你的需求私聊、群聊、发图片等添加对应权限。在Proma中配置打开Proma设置找到“飞书集成”或类似选项。填入从飞书开放平台获取的App ID、App Secret、加密密钥、验证令牌。填入你在事件订阅中设置的“请求地址”即ngrok生成的地址。保存配置并启动飞书服务。Proma通常会提供一个“启动飞书机器人”的开关。发布与启用回到飞书开放平台在“版本管理与发布”中创建一个版本并申请发布。审核通过企业自建应用通常自动通过后在飞书客户端中你就可以在聊天列表里找到这个应用并开始私聊或拉群了。重要提示使用ngrok等工具时每次重启服务地址都会变你需要同步更新飞书开放平台和Proma中的配置。对于长期使用建议使用有固定域名的云服务器或稳定的内网穿透服务。4. 高级技巧与深度优化指南4.1 记忆功能的精细化管理记忆不是简单的历史记录转储。Proma的记忆系统灵感来自MemOS应该具备提炼和索引能力。为了最大化其效用主动“喂养”记忆不要完全依赖自动提取。在关键对话后你可以手动进入记忆面板点击“添加记忆”用自然语言总结一条关于你自己的信息。例如“我是一名远程工作的全栈工程师主要使用Next.js和Go。”“我讨厌在报告里用‘赋能’、‘抓手’这类词。”“我负责的A项目下周要进行里程碑评审。” 这些结构化的事实比散乱的对话更易于AI检索和使用。使用标签分类如果Proma支持为记忆打标签或类似功能请善用它。创建如#工作习惯、#技术栈、#个人偏好、#项目背景等标签方便AI在特定场景下快速调用相关记忆。定期审视与清理记忆库会不断增长。每隔一段时间检查一下是否有过时或错误的记忆。例如你更换了主要技术栈就需要更新或删除旧的记忆条目防止AI给出基于陈旧信息的建议。4.2 构建自定义技能链虽然Proma内置和可发现安装的Skills很方便但真正的生产力飞跃来自于根据你自己的工作流定制技能链。利用MCP连接本地工具假设你每天需要从公司内部的一个特定数据库拉取报表数据。你可以编写一个简单的脚本Python/Node.js皆可将其包装成一个符合MCP协议的本地服务器。这个服务器暴露一个get_daily_report的工具。然后在Proma中配置连接到此MCP服务器。之后你只需要对Agent说“把今天的销售日报发我邮箱。”它就能自动调用你这个本地工具获取数据处理好后发送邮件。组合技能实现自动化Proma的Agent应该能顺序调用多个技能。你可以通过精心设计提示词来“训练”它形成固定流程。例如一个“周报生成”流程可以是1. 调用git_log工具获取本周代码提交。2. 调用jira_api工具获取本周处理的任务单。3. 调用notion_query工具获取本周记录的会议纪要和灵感。4. 综合以上信息调用write_report工具生成周报草稿。你可以将这个流程保存为一个“超级指令”或“预设”每次只需触发这个预设即可。4.3 Agent Teams的调度策略Proma的自动组队功能很强大但有时你需要更精细的控制。手动指定团队角色在给复杂任务时你可以在指令中明确指定“请组建一个包含‘架构师’、‘开发工程师’和‘测试员’的Agent团队来完成这个微服务API设计评审。架构师关注扩展性和技术选型开发关注实现细节测试员关注可测性和边界条件。” 这样AI会尝试根据你的描述来分配角色和任务。理解团队协作开销多Agent协作会产生额外的通信和协调成本。对于简单或线性任务使用单Agent模式可能更快、更直接。只有当任务确实可以高度并行化如同时调研多个不相关的主题或需要多领域专业知识如设计一个涉及硬件、软件、UI的产品时启用Teams的收益才最明显。监控与干预密切关注右侧的Agent工作状态面板。如果发现某个Agent卡住了或进入了无效循环不要犹豫使用/stop命令或手动中断然后调整指令重新开始。学会“指挥”AI团队和管理真人团队有相似之处。4.4 性能与成本优化模型选择的性价比不是所有任务都需要最强的模型。日常问答、文本润色、简单总结可以使用成本更低的gpt-4o-mini、claude-3-haiku或gemini-2.0-flash。只有进行复杂推理、规划或需要极高可靠性的任务时才切换到claude-3-5-sonnet或gpt-4o。在Proma中为不同会话预设不同的默认模型是个好习惯。上下文长度管理超长上下文如128K很诱人但会显著增加每次API调用的Token消耗和费用。对于长文档分析可以先使用Kimi这样的长上下文模型进行摘要和关键信息提取再将提取后的精简内容交给Claude或GPT进行深度分析和执行。Proma的多模型切换功能让这种“组合拳”变得非常方便。本地缓存的利用Proma的“本地优先”架构意味着所有对话历史、记忆都存储在本地。这不仅是隐私优势也是性能优势。当你反复查询类似问题时AI可以从本地历史中快速获取上下文减少不必要的重复计算和API调用。确保你的~/.proma目录所在磁盘有足够空间。5. 常见问题与故障排查实录在实际使用中你可能会遇到以下问题。这里记录了我的排查经验和解决方案。5.1 连接与配置问题问题1添加渠道时“测试连接”失败提示API Key无效或网络错误。排查步骤检查API Key首先确认API Key是否正确复制前后有无多余空格。去对应平台的控制台确认Key是否有效、是否有余额或调用次数。检查Base URL如果你使用的是第三方代理服务确保URL正确无误。对于OpenAI官方URL是https://api.openai.com/v1对于国内一些镜像站格式可能不同。检查网络环境某些API服务如OpenAI、Anthropic可能需要特定的网络条件才能访问。确认你的网络环境符合要求。查看详细日志Proma应该提供更详细的错误日志。在设置中寻找“高级”或“日志”选项查看具体的错误信息可能是SSL证书问题、超时或服务端拒绝。问题2飞书机器人配置成功但收不到消息或无法回复。排查步骤事件订阅URL验证这是最常见的问题。确保你在飞书开放平台填写的“请求地址”正是你Proma飞书服务运行且可被公网访问的地址。使用curl或浏览器访问这个地址看是否有响应。权限检查确认飞书应用已添加了正确的权限im:message等并且已经“发布”了最新版本。未发布或权限不足的应用无法正常接收消息。加密配置一致性确保Proma配置中的“加密密钥”和“验证令牌”与飞书开放平台“事件订阅”页面设置的一模一样一个字符都不能差。查看Proma日志启动Proma的飞书服务时查看其输出日志通常能明确看到连接状态、接收到的消息以及可能的错误信息。5.2 Agent与功能异常问题3切换Agent模式后AI不执行工具调用或者调用失败。排查步骤确认模型支持确保你为Agent模式选择的模型如Claude Sonnet确实支持工具调用功能。不是所有模型都支持。检查Skills/MCP状态在设置中查看已安装或连接的Skills/MCP服务器是否正常运行。一个失效的工具会导致整个调用链中断。简化指令测试用一个最简单的指令测试如“打开计算器”如果系统有对应工具。如果简单指令能行复杂指令不行可能是你的指令描述不够清晰导致AI规划出错。尝试将复杂指令拆解成更明确的步骤。查看思考过程打开“思考模式”观察AI在哪一步出错了。是规划不合理还是调用工具的参数不对这能给你提供最直接的线索。问题4记忆功能似乎没有起作用AI不记得之前说过的事情。排查步骤确认记忆已保存在记忆面板中检查你认为应该被记住的对话内容是否已经生成了一条记忆条目。有时自动提取可能不准确需要手动添加。检查记忆相关性AI在回答时会检索与当前问题最相关的记忆。如果你的问题表述和记忆中的关键词关联度很低可能检索不到。尝试使用更接近记忆条目中的词汇提问。会话隔离确认你是否开启了新的“会话”Proma的记忆可能是全局的但有些设计下不同会话间的记忆调用可能有策略限制。查看设置中关于记忆作用范围的选项。5.3 性能与使用体验问题5应用响应变慢特别是处理长上下文或开启多个Agent时。解决方案清理会话历史长期不用的、特别长的会话历史会占用内存也可能影响性能。定期归档或删除旧会话。限制并行任务同时运行多个耗资源的Agent Teams任务会给本地CPU/内存带来压力。尝试顺序执行任务。检查磁盘空间~/.proma目录如果过大可能会影响数据读写速度。可以考虑将数据目录迁移到更快的SSD硬盘上如果支持配置。更新应用确保你使用的是最新版本的Proma开发者可能已经优化了性能。问题6流式输出时出现卡顿或中断。解决方案网络稳定性流式输出对网络稳定性要求较高。检查你的网络连接。模型供应商限流免费或低级别的API Key可能会有速率限制。如果频繁卡顿可能是触发了限流。考虑升级套餐或降低请求频率。客户端渲染压力如果输出内容包含大量复杂渲染如大型Mermaid图表、复杂数学公式可能会暂时卡住。这是正常现象等待渲染完成即可。5.4 高级功能与扩展问题7想添加一个自定义的MCP服务器不知道如何开始。入门指引学习MCP协议首先阅读Claude官方关于Model Context Protocol的文档了解其基本概念和通信格式。参考示例在Proma的GitHub仓库或相关社区中寻找其他用户分享的MCP服务器示例代码。从最简单的“获取系统时间”工具开始模仿。使用SDK寻找社区维护的MCP服务器SDK如TypeScript/ Python可以简化开发流程。配置连接编写好服务器后在Proma的设置中找到MCP配置部分添加你的服务器地址例如http://localhost:8080和必要的认证信息。Proma作为一个正在快速演进的开源项目其边界由社区共同拓展。遇到问题时除了自查积极查阅项目GitHub的Issues、Discussions或者加入其用户社区往往是更快找到答案的途径。这个工具的魅力不仅在于它现在能做什么更在于它和它的使用者们一起正在定义未来的人机协作方式。

读完文章,也想定制专属网站?

尧图设计师 24 小时内与您沟通定制方案

免费获取报价