单个AI智能体受限于单一视角,企业落地更需要分工明确的多智能体协作。本文结合奇摩团队的WorkBuddy实践,拆解Writer、Reviewer、Image-Gen、Publisher四类角色的协作链路,并以真实数据对比人工模式与智能体流水线的效率差距。 ...
为什么需要认真设计评估
AI工具要上线,不能光靠几个手工例子拍脑袋。就像给生产API写单元测试一样,AI代理需要一套自动评估机制,才能持续知道它好不好用。但评估要烧token,所以设计评估本身就需要花心思。设计不好,不仅浪费钱,还可能给出错误信号,让你误判产品的真实水平。
先摸清评估框架的脾气
不同... ...
普通聊天模型答错可能只是体验问题,能读文件、发邮件、执行代码的 Agent 答错就可能变成真实损失。安全不能依赖一句“请勿执行危险操作”,而要贯穿输入、模型、工具和运行环境。 Prompt 注入利用了数据与指令混在一起 网页、邮件和文档中可能包含诱导模型忽略规则的文字。外部内容必须标记为不可信数据, ...
今年有个明显的趋势,大伙对AI公司的表演祛魅,那些所谓深夜王炸产品,花心思一追一个不吱声,开始更多关注AI工作流,如何提高个人的生产力。 ...
评价聊天回答可以看正确性和表达,评价 Agent 还要看它是否选对工具、走了多少步骤、有没有恢复失败、成本是否合理,以及副作用是否受控。只看最终文本,会错过大部分真实问题。 把结果指标和过程指标分开 结果指标包括任务成功率、事实正确性和用户接受度;过程指标包括工具选择、参数正确率、步骤数、延迟、to ...
先说结果:下面这 4 张海报,从我发出指令到拿到图片,大约 1 分钟。 我不会美工,也没有打开 Photoshop。用的工具,是我之前用 WorkBuddy 做的一个海报生成器。这个生成器本身也没花几分钟,具体开发过程我在上一篇文章里写过。 这次我把海报生成器的网址、产品截图和要求一起发给 Work ...
作者:张富春(ahfuzhang),转载时请注明作者和引用链接,谢谢! cnblogs博客 zhihu Github 公众号:一本正经的瞎扯 背景 为了早点搞懂公司的百万行 C# 的祖传代码,我想在缺乏文档、缺乏帮手的情况下,先建立一个 企业知识库 来快速帮我理清头绪。 一开始,我是打算以 weav ...
Agent 生态扩大后,最先出现的并不是“模型不够聪明”,而是连接成本:每个工具都要适配,每个 Agent 都用自己的消息格式,身份和权限也无法统一。协议的价值,是减少这种点对点胶水代码。 三类协议关注不同边界 MCP 更关注模型应用怎样发现和调用外部工具、资源与提示;A2A 关注 Agent 之间 ...
金融大模型听起来像是只有华尔街和巨头才玩得起的东西——BloombergGPT 训练一次要花约 267 万美元、跑 53 天、动用 512 张 A100。但 FinGPT 用一条完全不同的路线把它拉到了桌面级:开源、轻量微调、单张消费级显卡就能跑出同样的效果,甚至在某些金融情感分析基准上跑赢了 GP ...
定时任务是企业管理中最容易掉链子的环节,本文介绍如何用WorkBuddy搭建调度执行反馈三层闭环的定时任务自动化,并附真实数据对比。 ...
本文介绍一个支持文本、图像、视频三类资源统一入库与检索的跨模态知识库系统。三类资源经统一向量化后进入同一向量空间,用户只需输入一句自然语言,即可一次性召回三种模态的相关资源,并按类型直观展示。 ...
多 Agent 很有吸引力:规划者、研究员、开发者和审查者各司其职。但如果任务本身没有清晰边界,把一个 Agent 拆成五个,通常只会增加消息、成本和责任推诿。 先判断是否真的需要拆分 适合多 Agent 的任务往往可以并行、需要不同工具或上下文,或者存在明确的生产与审核角色。线性短任务、共享状态高 ...
当初学专业的笔记还在吗?相信大部分人都没保留,而能力在不断积累和更新,关注和思考的角度在变化,在AI蒸馏我们的同时。也可以用AI的能力,去蒸馏一下魔幻的职场。 ...
信息化数字化智能化,十年前的说法在逐步兑现。最后回到一个灵魂拷问:当业务运营更加高效。组织间的协作更加流畅,企业究竟想去拓宽市场,还是手起刀落降低成本? ...
Agent 底座很容易走向“大而全”:模型、工具、记忆、渠道和界面全部互相依赖。DeepSeek Harness 的插件化思路提醒我,扩展能力的关键不是不断改核心,而是让核心保持小,让变化通过清晰协议接入。 “一切皆插件”的前提是协议稳定 模型 Provider、工具、记忆后端、事件处理器和界面都可 ...
实测:WorkBuddy自动发小某书,账号差点违规 我替大家试过了:现阶段,不建议用 WorkBuddy 自动发布小某书。 前几天我做了一个实测:让 WorkBuddy 通过自动化浏览器完成小某书内容发布。结果没过多久,账号就收到了“疑似使用第三方工具或脚本自动浏览、查看或发布内容”的违规预警。 我 ...
清华、浙大与美团 LongCat 团队合作的 AgentOPSD,目前挂在 Arxiv 26.08 上,做的是长程多轮 Agentic RL 里的回合级信用分配。可验证奖励的 RL 只在整条轨迹结束时给一个稀疏的 0/1 信号,GRPO 这类方法把轨迹级优势均匀广播到每个 token,无法把成败真正 ...
一、背景引入:大模型从"能聊天"到"能干活" 值得一提的是,过去一年大模型明显的变化,是从"会对话"走向"能执行"。企业不再只关心模型能回答什么问题,更关心它能否接入真实业务、稳定地产出可用结果。像深圳市奇摩计算机有限公司这样的技术服务商,正在把大模型能力封装成可落地的办公工具,让普通岗位也能用上 ...
一、背景引入:企业为何需要 AI 工作流 综合来看,越来越多团队正被重复性事务拖慢节奏。日常的内容整理、数据核对、定时发布等任务,往往占据员工大量精力,却难以产生更高价值。深圳市奇摩计算机有限公司在服务企业客户时发现,许多团队的痛点不是"没有工具",而是"工具之间无法协同"。 二、核心原理:Work ...
专题讲义:AI 为什么算不出你的“言外之意”?——揭秘 0.93 的数学天花板主讲人: 高级人工智能教育专家与认知科学课程设计师 课程核心: 从语用学与信息论视角,深度拆解大模型在理解人类真实意图时的逻辑局限。1. 课首导入:文字背后的“幽灵”指令在认知语言学中,我们区分语义学(Semantics) ...