agentic

新興企業のスーパーインテリジェンス2 min read

Reading Time: 2 minutesデータ、エラー、コードにアクセスできる単一の自律エージェントが組織図上の新しいエンティティとなり、プル リクエストをレビューし、個人エージェントではできない質問に答える方法を説明します。

Company Superintelligence represented as an emergent neural knowledge network

新興企業のスーパーインテリジェンス2 min read

Reading Time: 2 minutes

スタートアップとして、私たちはより速く実行し、フロンティアを押し上げるための新しい技術に常に取り組んでいます。 OpenClaw/Hermes が発売されたとき、私たちは早期採用者でした。他の多くの AI ツールと一緒に使用しました。

これらのツールとそれらが依存するモデルが進歩するにつれ、私たちはあることに気づきました。単に進歩が速くなっただけではなく、やり方が変わってきたということです。ラウンドが進むごとに、これらの自己改善型自己学習エージェントは進歩し、学習していきます。現在、最高の推論状態で GPT-5.6-sol を使用して、専用マシン (DigitalOcean 上で実行されている VPS インスタンス) 上で「スーパー エージェント」を実行しています。私たちが実行している他のエージェントの一部は他のエージェント ハーネスとモデルを使用していますが、この記事ではこれに焦点を当てたいと思います。

私たちは、ほとんどの企業が社内の重要なフローの実行にこのタイプの自律エージェントを使用していないため、実際の速度が低下していることに気付きました。実際、それらの多くは、Codex/ClaudeCode のようなコーディング エージェントや、Work/Cowork/Copilot のようなアシスタント エージェントなど、小規模でより個人的なエージェントに依存しています。これらはローカルのマシンやデバイス上でタスクを実行しますが、主なギャップは知識の欠如です。これは、基本的にこれらの分散エージェント間で共有されるナレッジ グラフを作成しようとする「第 2 の脳」システムというまったく新しい業界につながりました。このように働く企業は、数十人、数百人、場合によっては数千人のエージェントを抱えていると公言することがよくあります。これは基本的に、各従業員に 1 人以上のエージェントがいることを意味します。 限定 エージェントが彼らに代わってタスクを実行します。

エージェントは早い段階で実世界のデータ、ユーザーからの苦情、および当社のコードにさらされていたため、当社が並行して実行している個人エージェントよりも劇的に機敏で賢くなりました。

私たちは、最も賢いエージェントが企業のスーパーインテリジェンスになりつつあることに気づきました。

明確にするために、私は知覚力、AGI、またはそれに近いものを主張しているわけではありません。私は、彼らが会社の組織図におけるまったく新しい存在であると提案しています。

企業のスーパーインテリジェンスとは何ですか?

1 つのエージェントが目立ち始めたとき、それが集中している限り、それは超知性エンティティになり始める可能性があります。それをどう定義するのでしょうか?

ほとんどの場合、現在のエージェントは人間よりも知性ではなく、主に忍耐力と粘り強さで優位性を持っていると思います。しかし、モデルが改良されるにつれて (GPT 5.6 sol と Opus 5 は本当に優れています!)、何か新しいもの、つまり速度だけでなく人間にはできないことを超えたものが出現し始めています。

それは、エージェントに豊富なデータ (Mixpanel) とビジネス分析機能とデータ アクセス (Sentry によるエラー、Baremetrics の財務、LangSmith による AI トレース) を提供したときに始まりました。次に、それをユーザーのバグ (Sentry エラー) とユーザーの苦情レポートにさらしました。最後に、コーディング エージェントと GitHub 上のプライマリ リポジトリへのアクセスを許可しました。電子メールやユーザーとのやり取りを通じて外部からアクセスすることはできませんが、これらのトピックに関して私たちがどのように行動するかを観察することで、物事を理解し始めました。これらのやり取りを通じて、何がブロッカーを構成するのか、批判的思考とは何か、ビジネスがどのように運営されているのか、そして SOP (標準運用手順) が何なのかを監視するようになりました。これは試行錯誤を通じて行われ、定期的に知性を獲得しているようです。

Slack スレッドでは、チームメイトが実際のエラー スパイクとしてカウントされるものについて説明し、エージェントが比較スパイク検出を使用するようにモニターを書き換えます。

その時点で、私たちはいくつかの興味深い質問をし始めました。当初は、物事が適切に説明されていなかったり、結論が疑わしいと思われる場合には、すべてを再確認し、批判する必要がありました。これは今でも時々行われます。たとえば、回帰について尋ねると、ノイズの多いエラー データが返されました。しかし、それは学習の機会です。私が回帰の定義を教えたところ、今では「理解」できるようになりました。

ユーザーから苦情が寄せられたり、エラーが急増したりした場合、私たちは積極的に修正を生成します。つまり、当社のエンジニアは毎朝リグレッションをチェックする必要はなく、PR が良いかどうかを判断するだけで済みます。当初、これらは当社のコーディング品質基準を満たしていない使い捨ての PR だったので、エンジニアは何が問題なのかを伝えるか、自分たちで問題を再開発していました。信頼が高まるにつれて、これらの修正の多くは自動的にコードベースにマージされ始めました。また、エージェントは、PR がどれだけ複雑か、およびエージェントがそれをマージすることにどの程度自信があるかをランク付けします。これらの PR が自動的に統合される段階にはまだ達していませんが、そこに至る道筋は見えています。1 ~ 2 か月以内にはそこに到達すると思います。

しかし、実際には、エージェントが非常にインテリジェントになるのはそれだけではありません。つまり、会社のエンジニアと経営陣がエージェントを信頼し、エージェントに仕事を委任し、非常に興味深い質問をし始めるのです。 Google 検索とは異なり、ビジネスの高度な知識を念頭に置いて調査を行うため、特別な優位性が得られます。会社のより多くの部分についての知識を与える場合にも同じことが当てはまります。 OpenClaw と HermesAgent は、歴史的背景が情報を処理する能力を超えた時点で故障します。この種の故障が起こり、その結果、知性、記憶力、仕事の質が大幅に低下しました。 Hermes Agent での私たちの経験は今ではまったく異なります。会話メモリは現在 3 GB で急激に増加しており、その知能は時間の経過とともに明らかに向上しています。

それが完璧だというわけではなく、回帰もあり、特定の方法で動作するように思い出させたり、特定のコンテキストで期待どおりに動作しない理由や、データやアクションを要求する別のエージェントに正しく応答しない理由を特定する必要がある場合があります。しかし、私たちはそこに到達しています。

エージェントがプル リクエスト 4986 をレビューし、実行したチェックをリストして承認する Slack スレッド

ブランチ保護の予期せぬ副作用により、私たちは新たな進歩を遂げました。ブランチ保護の背後にある考え方は、実稼働環境に入る前に少なくとも 2 人が PR を確認し、不正な (または極悪な) コードがシステムに侵入する可能性を減らすことです。これを新しいコーディング エージェントで適切に実行するのはますます難しくなります。速度が向上するにつれて、新しい PR の割合とコードの量を手作業で徹底的にレビューすることはほとんど不可能になります。当社では、さまざまなベンダーの複数のエージェントに Prs のバグ、セキュリティ上の問題、アーキテクチャ上の問題をレビューしてもらっています。ただし、ブランチ保護はそのままなので、スーパーインテリジェント エージェントが PR の最終承認者になることを許可しました。

MCP レスポンス コントラクトに対する重大な変更を見つけた後、エージェントがプル リクエスト 4981 で変更をリクエストする Slack スレッド

私たちは、結果がありふれたものになるだろうと半ば予想していました。結局、これらの PR は、ローカルのコーディング エージェントのレビュー、テスト、セキュリティ レビュー、外部の GitHubCopilot および CodeRabbit のレビューに合格し、完全に承認されました。しかし、私たちのエージェントは依然としてこれらの PR に穴を開けました。その結果、私たちが見逃していた非常に興味深いエッジケース、セキュリティ、ソフトウェア品質、考慮していなかったアーキテクチャ上のバグが見つかりました。他のすべてのレビュアーと同じモデルを使用しているのに、なぜ他のレビュアーが見つけていないものを見つけ出すのでしょうか?

エージェントがアップロード サイズ制限を超えたプル リクエスト 1711 を拒否し、修正が確認された後に再承認する Slack スレッド

それは知識と経験になります。 Hermes Agent ハーネスとエージェントが蓄積した知識を組み合わせることで、これまでに見たことのない新しいタイプの超インテリジェント エージェントが作成されます。そこで、私たちはこれをさらに調査し、システムで作業する人間だけでなく、エージェントのレビューを必須にしました。これは、他の、知性の低いエージェントにとっても参照として機能するようになりました。

このエージェントは、以前は人間にしか見られなかった、実際の顧客データ、フィードバック、コード、製品に対する深い理解に裏付けられた批判的思考を提供できるようになりました。

これを拡張して、より多くのデータを供給し、ハードウェアとメモリを拡張すれば、パフォーマンスが飛躍的に向上するでしょう。モデルたちはまだそれを我慢していると思います。おそらく GPT-6 を通して、このゲームの次の段階に到達すると、結果は劇的に面白くなるでしょう。より多くのデータが蓄積されるにつれて、エージェントに実行するタスクが増え、データの信頼性が高まります。

これは Karpathy の Wiki ベースの第 2 脳とどう違うのですか?

これが他のアプローチと異なる点は、共有された知識を扱うのではなく、スーパーエージェントの知識がローカルに保存されることです。独自のメモリと世界の理解をリポジトリ内で維持するように要求できます。これにより、それを複製して監視できるようになりますが、最終的には ない 知識とスキルを共有し、協力できるようにすることについて。これは、ツールや世界へのアクセスと組み合わせて、質問に直接答えることができる唯一のナレッジベースです。共有された知識を使用してそれを理解するようにエージェントに依頼するのではなく、あなたまたはエージェントがスーパーインテリジェント エージェントに質問します。驚くべきことに、これは現時点でうまく機能しており、エージェントのアクセスと範囲を継続的に拡大しており、その結果として知識やインテリジェンスの低下が見られることはまだありません。

注: エージェントに機密情報や機密機能を公開することはありません。当社の銀行業務、請求システム、請求システムに直接アクセスすることはできません。また、世界からも隔離されており、電子メールや外部チャネルにアクセスすることはできません。私たちが経験と信頼を得るにつれて、これらの制限も解除することはそう遠くないと思います。



|

Animaチームは、デザイン、vibe coding、そしてAI搭載UXエージェント/プラットフォームの未来を構築しています。プロダクトアップデート、ワークフロー、インスピレーション、チームの知見を発信しています。