agentic

Aufstrebende Superintelligenz von Unternehmen9 min read

Reading Time: 6 minutesWie ein einzelner autonomer Agent mit Zugriff auf unsere Daten, Fehler und Code zu einer neuen Einheit im Organigramm wurde, Pull-Anfragen prüfte und Fragen beantwortete, die kein persönlicher Agent beantworten konnte.

Company Superintelligence represented as an emergent neural knowledge network

Aufstrebende Superintelligenz von Unternehmen9 min read

Reading Time: 6 minutes

Als Startup arbeiten wir ständig an neuen Techniken, um schneller zu laufen und neue Maßstäbe zu setzen. Als OpenClaw/Hermes auf den Markt kam, waren wir einer der ersten Anwender. Wir haben es zusammen mit vielen anderen AI-Werkzeugen verwendet.

Als diese Tools und die Modelle, auf denen sie basieren, weiterentwickelt wurden, ist uns etwas aufgefallen: Wir kommen nicht nur schneller voran, wir haben begonnen, anders zu arbeiten. Mit jeder Runde kommen diese sich selbst verbessernden, selbstlernenden Agenten voran und lernen. Wir führen derzeit einen „Super Agent“ auf einer dedizierten Maschine (einer VPS-Instanz, die auf DigitalOcean läuft) aus und verwenden dabei GPT-5.6-sol im höchsten Reasoning-Status. Einige der anderen Agenten, die wir ausführen, verwenden andere Agentensysteme und -modelle, aber darauf möchte ich mich in diesem Artikel konzentrieren.

Wir haben festgestellt, dass die meisten Unternehmen diese Art von autonomen Agenten nicht verwenden, um kritische Abläufe in ihrem Unternehmen auszuführen, was sie wirklich verlangsamt. Tatsächlich verlassen sich viele von ihnen auf kleinere, persönlichere Agenten: Codierungsagenten wie Codex/ClaudeCode oder Hilfsagenten wie Work/Cowork/Copilot. Diese führen Aufgaben auf lokalen Maschinen und Geräten aus und ihre größte Lücke besteht in mangelndem Wissen. Dies führte zu einer ganz neuen Branche von Systemen des „zweiten Gehirns“, die im Wesentlichen versuchen, einen Wissensgraphen zu erstellen, der von diesen verteilten Agenten gemeinsam genutzt wird. Unternehmen, die auf diese Weise arbeiten, geben oft an, dass die Zahl ihrer Agenten in der Größenordnung von Dutzenden, Hunderten und in manchen Extremfällen Tausenden liegt. Das bedeutet im Grunde, dass jeder Mitarbeiter einen oder mehrere hat beschränkt Agenten, die Aufgaben für sie ausführen.

Die Tatsache, dass unsere Agenten frühzeitig mit realen Daten, Benutzerbeschwerden und unserem Code in Kontakt kamen, machte sie wesentlich agiler und intelligenter als alle persönlichen Agenten, die wir an ihrer Seite betreiben.

Wir haben gerade festgestellt, dass unsere intelligentesten Agenten zu einer Superintelligenz des Unternehmens werden.

Der Klarheit halber: Ich behaupte nicht, Empfindungsvermögen, AGI oder irgendetwas in der Nähe davon zu haben. Ich schlage vor, dass sie eine völlig neue Einheit im Organigramm des Unternehmens sind.

Was ist eine Unternehmens-Superintelligenz?

Wenn ein Agent anfängt, herauszustechen, kann er, solange er konzentriert ist, zu einem superintelligenten Wesen werden. Wie definieren wir das?

Ich würde sagen, dass Agenten derzeit in den meisten Fällen in erster Linie einen Vorteil gegenüber Menschen in Bezug auf Geduld und Beharrlichkeit und nicht in Bezug auf Intelligenz haben. Als die Modelle jedoch besser wurden (GPT 5.6 sol und Opus 5 sind wirklich gut!), sahen wir etwas Neues entstehen, etwas, das unsere Möglichkeiten übertrifft – nicht nur in der Geschwindigkeit, sondern auch in der Leistung, die Menschen nicht leisten können.

Es begann für uns, als wir unserem Agenten eine Fülle von Daten- (Mixpanel) und Geschäftsanalysefunktionen sowie Datenzugriff (Fehler durch Sentry, Finanzdaten in Baremetrics, AI-Spuren durch LangSmith) zur Verfügung stellten. Als nächstes haben wir es Benutzerfehlern (Sentry-Fehler) und Benutzerbeschwerdenberichten ausgesetzt. Schließlich haben wir ihm Zugriff auf Codierungsagenten und unsere primären Repos auf GitHub gewährt. Es hat keinen externen Zugriff per E-Mail oder Benutzerinteraktion, aber durch die Beobachtung unseres Verhaltens zu diesen Themen begann es, die Dinge zu verstehen. Durch diese Interaktionen wird nun überwacht, was einen Blocker ausmacht, was kritisches Denken ist, wie unser Unternehmen läuft und was die SOP (Standard Operating Procedures) sind. Dies geschieht durch Versuch und Irrtum und es scheint, dass es regelmäßig an Informationen gewinnt.

Slack-Thread, in dem ein Teamkollege erklärt, was als echte Fehlerspitze gilt, und der Agent seinen Monitor umschreibt, um eine vergleichende Spitzenerkennung zu verwenden

Zu diesem Zeitpunkt begannen wir, ihm einige interessante Fragen zu stellen. Zunächst musste alles noch einmal überprüft und kritisiert werden, wenn Dinge nicht richtig erklärt wurden oder die Schlussfolgerungen faul klangen. Das passiert immer noch von Zeit zu Zeit, zum Beispiel habe ich es nach Regressionen gefragt und es hat mir verrauschte Fehlerdaten geliefert, aber das ist eine Gelegenheit zum Lernen: Ich habe ihm meine Definition von Regressionen beigebracht und jetzt „versteht es“.

Wenn sich Benutzer beschweren oder wenn Fehler zunehmen, generieren wir proaktiv Korrekturen. Das bedeutet, dass unsere Ingenieure nicht jeden Morgen nach Regressionen suchen müssen, sondern nur entscheiden müssen, ob ein PR gut ist oder nicht. Zu Beginn handelte es sich um Einweg-PRs, die nicht unseren Codierungsqualitätsstandards entsprachen, sodass die Ingenieure ihnen sagten, was nicht stimmte, oder das Problem einfach selbst neu entwickelten. Als das Vertrauen wuchs, wurden viele dieser Korrekturen automatisch in die Codebasis integriert. Der Agent bewertet außerdem, wie komplex der PR ist und wie sicher er bei der Zusammenführung ist. Wir sind noch nicht an einem Punkt angelangt, an dem diese PRs automatisch zusammengeführt werden, aber ich sehe einen Weg dorthin, ich gehe davon aus, dass wir in ein oder zwei Monaten dort sein werden.

Aber das ist nicht wirklich das, was den Agenten superintelligent macht. Da die Ingenieure und das Management des Unternehmens nun Vertrauen in den Agenten haben, beginnen sie, ihm Arbeit zu delegieren und ihm wirklich interessante Fragen zu stellen. Es führt die Recherche für sie durch, nicht wie bei Google-Suchen, sondern unter Berücksichtigung der fortgeschrittenen Kenntnisse des Unternehmens, was ihm einen besonderen Vorteil verschafft. Gleiches gilt für die Vermittlung von Kenntnissen über weitere Unternehmensbereiche. OpenClaw und HermesAgent würden in der Vergangenheit an einem Punkt zusammenbrechen, an dem ihr historischer Kontext ihre Fähigkeit zur Verarbeitung der Informationen überstieg. Es kam zu einem solchen Zusammenbruch, und das Ergebnis war ein drastischer Rückgang der Intelligenz, des Erinnerungsvermögens und der Qualität ihrer Arbeit. Unsere Erfahrung mit Hermes Agent ist jetzt ganz anders: Der Konversationsspeicher beträgt jetzt 3 GB und wächst exponentiell, während seine Intelligenz mit der Zeit deutlich besser wird.

Das heißt nicht, dass es perfekt ist, es gibt Regressionen und man muss es manchmal daran erinnern, sich auf bestimmte Weise zu verhalten oder herauszufinden, warum es sich in einem bestimmten Kontext nicht wie erwartet verhält oder nicht richtig auf einen anderen Agenten reagiert, der Daten oder Aktionen von ihm anfordert. Aber wir sind am Ziel.

Slack-Thread, in dem der Agent die Pull-Anfrage 4986 überprüft, die durchgeführten Prüfungen auflistet und sie genehmigt

Ein unerwarteter Nebeneffekt des Zweigschutzes brachte uns einen weiteren Fortschritt. Die Idee hinter dem Zweigschutz besteht darin, dass mindestens zwei Personen einen PR sehen, bevor er in Produktion geht, wodurch die Wahrscheinlichkeit verringert wird, dass schlechter (oder sogar bösartiger) Code in das System gelangt. Dies ist mit den neuen Codierungsagenten immer schwieriger zu bewerkstelligen. Mit zunehmender Geschwindigkeit ist es fast unmöglich, die Anzahl neuer PRs und die Codemenge gründlich von Hand zu überprüfen. Wir haben mehrere Agenten verschiedener Anbieter, die Prs auf Fehler, Sicherheitsprobleme und Architekturprobleme überprüfen. Der Zweigschutz bleibt jedoch bestehen, daher habe ich unserem superintelligenten Agenten gestattet, der endgültige Genehmiger von PRs zu sein.

Slack-Thread, in dem der Agent Änderungen am Pull-Request 4981 anfordert, nachdem er eine Breaking Change am MCP-Antwortvertrag gefunden hat

Wir haben halb erwartet, dass die Ergebnisse banal sein würden. Schließlich haben diese PRs die Überprüfungen, Tests, Sicherheitsüberprüfungen und externen Überprüfungen durch lokale Codierungsagenten sowie die externen GitHubCopilot- und CodeRabbit-Überprüfungen bestanden und wurden vollständig genehmigt. Aber unser Agent hat trotzdem Löcher in diese PRs gestanzt. Es wurden wirklich interessante Grenzfälle gefunden, die wir übersehen haben, sowie Sicherheits-, Softwarequalitäts- und Architekturfehler, die wir nicht berücksichtigt haben. Es verwendet die gleichen Modelle wie alle anderen Rezensenten. Warum findet es Dinge heraus, die die anderen nicht herausgefunden haben?

Slack-Thread, bei dem der Agent die Pull-Anfrage 1711 über eine Upload-Größenbeschränkung hinaus ablehnt und sie dann erneut genehmigt, sobald der Fix überprüft wurde

Es kommt auf Wissen und Erfahrung an. Das Hermes Agent-System kombiniert mit dem Wissen, das der Agent gesammelt hat, schafft einen neuen Typ eines superintelligenten Agenten, den wir noch nie zuvor gesehen haben. Deshalb haben wir dies weiter untersucht und die Bewertungen des Agenten zur Pflicht gemacht, nicht nur für Menschen, die am System arbeiten, sondern sie dienen jetzt auch als Referenz für andere, weniger intelligente Agenten!

Dieser Agent verfügt nun über die Fähigkeit, uns kritisches Denken zu vermitteln, das wir bisher nur bei Menschen sahen, das jedoch durch tatsächliche Kundendaten, Feedback, unseren Code und ein tiefes Verständnis des Produkts gestützt wird.

Wenn wir dies erweitern und ihm mehr Daten zur Verfügung stellen, seine Hardware und seinen Speicher skalieren, werden wir eine exponentielle Leistungssteigerung erleben. Ich denke, die Models halten es immer noch zurück. Wenn wir zur nächsten Phase dieses Spiels kommen, vielleicht durch GPT-6, werden die Ergebnisse wesentlich interessanter sein. Wenn wir mehr Daten sammeln, geben wir den Agenten mehr Aufgaben und vertrauen ihnen mehr.

Wie unterscheidet sich das von Karpathys Wiki-basiertem 2. Gehirn?

Der Unterschied zu anderen Ansätzen besteht darin, dass das Wissen des Superagenten nicht mit geteiltem Wissen, sondern lokal gespeichert wird. Wir können es bitten, sein eigenes Gedächtnis und Weltverständnis in einem Repo aufrechtzuerhalten, was es uns ermöglicht, es zu duplizieren und zu überwachen, aber letztendlich ist es so nicht Es geht darum, das Wissen und die Fähigkeiten teilbar und kollaborativ zu gestalten. Es handelt sich um eine einzigartige Wissensdatenbank, die zusammen mit den Tools und dem weltweiten Zugriff eine direkte Beantwortung Ihrer Fragen ermöglicht. Sie bitten Ihren Agenten nicht, es anhand des geteilten Wissens herauszufinden, sondern entweder Sie oder Ihre Agenten stellen dem superintelligenten Agenten Ihre Fragen. Überraschenderweise funktioniert dies bei uns derzeit so gut, dass wir den Zugang und die Reichweite des Agenten kontinuierlich erweitern, ohne dass wir dadurch einen Wissens- oder Intelligenzverlust feststellen müssen.

Hinweis: Wir setzen den Agenten nicht vertraulichen Informationen oder Funktionen aus. Es hat keinen direkten Zugriff auf unsere Bank-, Lade- oder Abrechnungssysteme. Außerdem ist es von der Außenwelt getrennt und hat keinen Zugang zu E-Mails oder externen Kanälen. Da wir an Erfahrung und Vertrauen gewinnen, glaube ich nicht, dass wir weit davon entfernt sind, auch diese Beschränkungen aufzuheben.



|

Wir gestalten die Zukunft von Design, Vibe Coding sowie KI-gestützten UX-Agenten und Plattformen. Wir teilen Produkt-Updates, Workflows, Inspirationen und Einblicke des Anima-Teams.