agentic

新兴公司超级智能2 min read

Reading Time: 1 minute一个能够访问我们的数据、错误和代码的自治代理如何成为组织结构图上的一个新实体,审查拉取请求并回答私人代理无法做到的问题。

Company Superintelligence represented as an emergent neural knowledge network

新兴公司超级智能2 min read

Reading Time: 1 minute

作为一家初创公司,我们不断致力于新技术,以提高运行速度并推动前沿发展。当 OpenClaw/Hermes 推出时,我们是早期采用者。我们将它与许多其他 AI 工具一起使用。

随着这些工具以及它们所依赖的模型的进步,我们注意到一些事情:我们不仅进步得更快,而且开始以不同的方式工作。在每一轮中,这些自我改进的自学习代理都在进步和学习。我们目前正在专用机器(在 DigitalOcean 上运行的 VPS 实例)上使用 GPT-5.6-sol 在最高推理状态下运行“超级代理”。我们正在运行的其他一些代理使用其他代理工具和模型,但这是我想在本文中重点讨论的一个。

我们注意到,大多数公司并没有使用这种类型的自主代理来运行公司中的关键流程,这确实减慢了他们的速度。事实上,他们中的许多人依赖于更小、更个人化的代理:像 Codex/ClaudeCode 这样的编码代理或像 Work/Cowork/Copilot 这样的助理代理。它们在本地机器和设备上执行任务,他们的主要差距是缺乏知识。这催生了一个全新的“第二大脑”系统行业,该系统本质上是试图创建一个在这些分布式代理之间共享的知识图谱。以这种方式工作的公司经常宣称他们拥有数十、数百甚至数千的座席。这基本上意味着每个员工都有一名或多名 有限的 代理为他们执行任务。

事实上,代理很早就接触到了现实世界的数据、用户投诉和我们的代码,这使得他们比我们与他们一起运行的任何个人代理都更加敏捷和聪明。

我们刚刚意识到,我们最聪明的代理人正在成为公司的超级智能。

为了清楚起见:我并不是在声称有感知能力,AGI 或类似的东西。我建议他们是公司组织结构图中的一个全新实体。

什么是公司超级智能?

当一个智能体开始脱颖而出时,只要它专注,它就可以开始成为一个超级智能实体。我们如何定义它?

我想说,在大多数情况下,智能体目前的优势主要在于耐心和坚持,而不是智力优于人类。然而,随着模型变得更好(GPT 5.6 sol 和 Opus 5 真的很棒!),我们开始看到一些新的东西出现,一些超越我们能做的事情 – 不仅在速度上,而且在做人类做不到的事情上。

当我们为代理提供丰富的数据 (Mixpanel) 和业务分析功能以及数据访问(通过 Sentry 的错误、Baremetrics 的财务信息、通过 LangSmith 的 AI 跟踪)时,这一切就开始了。接下来,我们将其暴露给用户错误(Sentry 错误)和用户投诉报告。最后,我们允许它访问编码代理和我们在 GitHub 上的主要存储库。它无法通过电子邮件或任何用户交互进行外部访问,但通过观察我们在这些主题上的行为,它开始理解事物。通过这些交互,它现在可以监控什么是阻碍因素、什么是批判性思维、我们的业务如何运行以及 SOP(标准操作程序)是什么。它通过反复试验来做到这一点,并且似乎正在定期获取情报。

Slack 线程,其中队友解释什么算作真正的错误峰值,代理重写其监视器以使用比较峰值检测

从那时起,我们开始问它一些有趣的问题。起初,当事情没有得到正确解释或结论听起来可疑时,一切都需要双重检查和批评。它仍然时不时地这样做,例如,我向它询问回归,它给了我嘈杂的错误数据,但这是一个学习机会:我教它我对回归的定义,现在它“明白了”。

当用户抱怨或错误激增时,我们会主动生成修复程序。这意味着每天早上,我们的工程师不必检查回归,他们只需要确定 PR 是否良好。一开始,这些是一次性的 PR,不符合我们的编码质量标准,因此工程师会告诉它出了什么问题,或者自己重新开发问题。随着信任的增长,许多修复开始自动合并到代码库中。该代理还对 PR 的复杂程度以及代理对其合并的信心程度进行排名。我们还没有到这些 PR 自动合并的地步,但我看到了一条路径,我想我们会在一两个月内到达那里。

但这并不是让智能体变得超级智能的真正原因。现在公司的工程师和管理层信任代理,他们开始将工作委派给代理,并向其提出真正有趣的问题。它为他们进行研究,不像谷歌搜索,而是考虑到了先进的业务知识,这赋予了它特殊的优势。这同样适用于让其了解公司更多部门的知识。 OpenClaw 和 HermesAgent 历史上会在其历史背景超出其处理信息能力的某个时刻崩溃。这种类型的崩溃将会发生,其结果是他们的智力、记忆力和工作质量急剧下降。现在,我们对 Hermes Agent 的体验已大不相同:对话内存现在为 3GB,并且呈指数级增长,而其智能随着时间的推移而明显提高。

这并不是说它是完美的,存在回归,您有时必须提醒它以某些方式行事,或者确定为什么它在特定上下文中没有按照您的预期行事,或者正确响应另一个向其请求数据或操作的代理。但是,我们正在实现这一目标。

代理审查拉取请求 4986、列出其运行的检查并批准它的 Slack 线程

分支保护的一个意想不到的副作用给我们带来了另一个进步。分支保护背后的想法是,在 PR 投入生产之前,至少有两个人看到它,从而减少不良(甚至恶意)代码进入系统的机会。使用新的编码代理很难正确地做到这一点。随着速度的提高,PR 的新增速度和代码数量几乎不可能通过手工彻底检查。我们有来自不同供应商的多名代理审查 Prs 中的错误、安全问题和架构问题。然而,分支保护仍然存在,所以我允许我们的超级智能代理成为 PR 的最终批准者。

Slack 线程,其中代理在发现 MCP 响应合约的重大更改后请求对拉取请求 4981 进行更改

我们一半预计结果会很平凡。毕竟,这些PR通过了本地编码代理审查、测试、安全审查、外部GitHubCopilot和CodeRabbit审查,并获得完全批准。但我们的特工仍然在那些 PR 上打了洞。它发现了我们错过的非常有趣的边缘情况、我们没有考虑到的安全性、软件质量和架构错误。它使用与所有其他审阅者相同的模型,为什么它能找出其他人没有找出的东西?

Slack 线程,其中代理拒绝超过上传大小限制的拉取请求 1711,然后在验证修复后重新批准它

这取决于知识和经验。 Hermes Agent 安全带与智能体积累的知识相结合,创造了一种我们以前从未见过的新型超级智能智能体。因此,我们进一步探索了这一点,并将代理的审查强制执行,不仅适用于在系统上工作的人类,而且现在它还可以作为其他智能程度较低的代理的参考!

该代理现在能够为我们提供批判性思维,这是我们以前只能在人类身上看到的,但有实际客户数据、反馈、我们的代码和对产品的深刻理解的支持。

如果我们对此进行扩展,并为其提供更多数据,扩展其硬件和内存,我们将看到性能呈指数级增长。我认为模型仍然在阻碍它。当我们进入游戏的下一阶段时,也许通过 GPT-6,结果将变得更加有趣。随着我们积累更多的数据,给代理更多的任务来完成并更加信任它。

这与卡帕蒂基于维基的第二大脑有何不同?

这种方法与其他方法的不同之处在于,超级代理知识不是处理共享知识,而是存储在本地。我们可以要求它在存储库中维护自己的记忆和世界理解,这允许我们复制它并监控它,但最终它是 不是 关于使知识和技能可共享和协作。这是一个独特的知识库,加上工具和世界访问权限,可以直接回答您的问题。你不会要求你的代理人使用共享知识来解决这个问题,你或你的代理人都会向超级智能代理人询问你的问题。令人惊讶的是,这对我们来说效果很好,我们不断扩大代理的访问范围和覆盖范围,但我们还没有看到知识或智力因此而下降。

注意:我们不会向代理公开敏感信息或功能。它无法直接访问我们的银行、收费或计费系统。它也与世界隔离,无法访问电子邮件或外部渠道。随着我们积累经验和信任,我认为我们离取消这些限制也就不远了。



|

CTO