agentic

신흥 회사 초지능2 min read

Reading Time: 5 minutes데이터, 오류 및 코드에 액세스할 수 있는 단일 자율 에이전트가 조직도의 새로운 개체가 되어 풀 요청을 검토하고 개인 에이전트가 할 수 없는 질문에 답변한 방법입니다.

Company Superintelligence represented as an emergent neural knowledge network

신흥 회사 초지능2 min read

Reading Time: 5 minutes

스타트업으로서 우리는 더 빠르게 달리고 한계를 뛰어넘기 위해 끊임없이 새로운 기술을 연구하고 있습니다. OpenClaw/Hermes가 출시되었을 때 우리는 얼리 어답터였습니다. 우리는 이를 다른 많은 AI 도구와 함께 사용했습니다.

이러한 도구와 그에 의존하는 모델이 발전하면서 우리는 뭔가를 알아차렸습니다. 우리는 더 빠르게 발전할 뿐만 아니라 다르게 작업하기 시작했습니다. 각 라운드마다 이러한 자기 개선 자기 학습 에이전트는 발전하고 학습하고 있습니다. 우리는 현재 가장 높은 추론 상태에서 GPT-5.6-sol를 사용하여 전용 머신(DigitalOcean에서 실행되는 VPS 인스턴스)에서 “슈퍼 에이전트”를 실행하고 있습니다. 우리가 실행하고 있는 다른 에이전트 중 일부는 다른 에이전트 하네스 및 모델을 사용하지만 이것이 바로 이 기사에서 집중하고 싶은 것입니다.

우리는 대부분의 회사가 회사의 중요한 흐름을 실행하기 위해 이러한 유형의 자율 에이전트를 사용하지 않고 있으며 이로 인해 속도가 실제로 느려지는 것을 확인했습니다. 실제로 이들 중 다수는 Codex/ClaudeCode와 같은 코딩 에이전트 또는 Work/Cowork/Copilot와 같은 보조 에이전트와 같이 더 작고 더 개인적인 에이전트에 의존합니다. 이는 로컬 시스템 및 장치에서 작업을 수행하며 가장 큰 차이점은 지식이 부족하다는 것입니다. 이로 인해 본질적으로 이러한 분산 에이전트 간에 공유되는 지식 그래프를 생성하려고 시도하는 완전히 새로운 “두 번째 두뇌” 시스템 산업이 탄생했습니다. 이와 같이 일하는 회사에서는 종종 수십, 수백, 일부 극단적인 경우 수천 명의 상담원이 있다고 주장합니다. 이는 기본적으로 각 직원이 한 명 이상의 상담원을 보유하고 있음을 의미합니다. 제한된 그들을 위해 작업을 수행하는 에이전트.

에이전트가 실제 데이터, 사용자 불만 사항 및 코드에 조기에 노출되었다는 사실로 인해 우리가 함께 실행하는 어떤 개인 에이전트보다 훨씬 더 민첩하고 똑똑해졌습니다.

우리는 가장 똑똑한 에이전트가 회사의 초지능이 되고 있다는 것을 깨달았습니다.

명확하게 하기 위해 저는 AGI 또는 이와 유사한 어떤 감각도 주장하지 않습니다. 나는 그들이 회사 조직도의 새로운 법인임을 제안합니다.

회사의 초지능이란 무엇입니까?

하나의 에이전트가 눈에 띄기 시작하면 집중하는 한 슈퍼인텔리전트 개체가 되기 시작할 수 있습니다. 우리는 그것을 어떻게 정의합니까?

대부분의 경우 현재 에이전트는 인간보다 지능이 뛰어난 것이 아니라 주로 인내와 끈기라는 이점을 갖고 있다고 말하고 싶습니다. 그러나 모델이 더 좋아지면서(GPT 5.6 sol 및 Opus 5는 정말 좋습니다!) 우리는 속도뿐만 아니라 인간이 할 수 없는 작업을 수행하면서 우리가 할 수 있는 것을 능가하는 새로운 것이 나타나는 것을 보기 시작했습니다.

에이전트에게 풍부한 데이터(Mixpanel) 및 비즈니스 분석 기능과 데이터 액세스(Sentry를 통한 오류, Baremetrics의 재무, LangSmith를 통한 AI 추적)를 제공했을 때 시작되었습니다. 다음으로 사용자 버그(Sentry 오류) 및 사용자 불만 신고에 노출했습니다. 마지막으로 GitHub의 코딩 에이전트와 기본 저장소에 대한 액세스 권한을 부여했습니다. 이메일이나 사용자 상호 작용을 통한 외부 액세스는 없지만 이러한 주제에 대해 우리가 어떻게 행동하는지 관찰함으로써 상황을 이해하기 시작했습니다. 이러한 상호 작용을 통해 이제 차단 요소가 무엇인지, 비판적 사고가 무엇인지, 비즈니스 운영 방식 및 SOP(표준 운영 절차)가 무엇인지 모니터링합니다. 시행착오를 통해 이를 수행하며 정기적으로 지능을 얻는 것 같습니다.

팀원이 실제 오류 스파이크로 간주되는 사항을 설명하고 에이전트가 비교 스파이크 감지를 사용하기 위해 모니터를 다시 작성하는 Slack 스레드

그 시점에서 우리는 몇 가지 흥미로운 질문을 하기 시작했습니다. 처음에는 모든 것이 제대로 설명되지 않았거나 결론이 수상쩍게 들리면 다시 확인하고 비판해야 했습니다. 예를 들어 회귀에 대해 물었고 시끄러운 오류 데이터를 제공했지만 이는 학습 기회입니다. 회귀에 대한 정의를 가르쳤고 이제는 “얻습니다”.

사용자가 불만을 제기하거나 오류가 급증하면 사전에 수정 사항을 생성합니다. 즉, 매일 아침 엔지니어들이 회귀를 확인할 필요가 없으며 PR가 좋은지 여부만 결정하면 됩니다. 처음에는 이것들이 우리의 코딩 품질 표준을 충족하지 않는 일회용 PR였기 때문에 엔지니어들은 무엇이 잘못되었는지 알려주거나 문제를 스스로 재개발했습니다. 신뢰가 높아짐에 따라 이러한 수정 사항 중 상당수가 자동으로 코드베이스에 병합되기 시작했습니다. 또한 에이전트는 PR가 얼마나 복잡한지, 에이전트가 이를 병합하는 데 얼마나 자신감을 갖고 있는지 순위를 매깁니다. PR가 자동으로 병합되는 시점은 아니지만 경로가 보입니다. 한두 달 안에 도착할 것으로 예상됩니다.

그러나 그것이 실제로 에이전트를 매우 지능적으로 만드는 것은 아닙니다. 이제 회사의 엔지니어와 경영진이 에이전트에 대한 신뢰를 갖게 되었기 때문에 에이전트에 작업을 위임하고 정말 흥미로운 질문을 하기 시작했습니다. 이는 Google 검색과 달리 비즈니스에 대한 고급 지식을 염두에 두고 조사를 수행하므로 특별한 이점을 제공합니다. 회사의 더 많은 부분에 대한 지식을 제공하는 경우에도 마찬가지입니다. OpenClaw 및 HermesAgent는 역사적 맥락이 정보 처리 능력을 초과하는 특정 지점에서 역사적으로 고장났습니다. 그러한 유형의 고장이 발생하고 그 결과 지능, 기억력 및 작업 품질이 급격히 떨어졌습니다. Hermes Agent에 대한 우리의 경험은 이제 상당히 다릅니다. 대화형 메모리는 이제 3GB로 기하급수적으로 증가하고 있으며 시간이 지남에 따라 지능이 확실히 향상되고 있습니다.

완벽하다는 말은 아닙니다. 회귀가 있으며 때때로 특정 방식으로 작동하도록 상기시키거나 특정 컨텍스트에서 예상대로 작동하지 않는 이유를 식별하거나 데이터나 작업을 요청하는 다른 에이전트에 올바르게 응답해야 합니다. 하지만 우리는 거기에 도달하고 있습니다.

에이전트가 풀 요청 4986을 검토하고 실행한 검사를 나열하고 승인하는 Slack 스레드

가지 보호의 예상치 못한 부작용은 우리에게 또 다른 발전을 가져왔습니다. 분기 보호의 기본 아이디어는 PR가 프로덕션에 들어가기 전에 최소한 두 사람이 이를 확인하여 나쁜(또는 심지어 사악한) 코드가 시스템에 들어갈 가능성을 줄이는 것입니다. 새로운 코딩 에이전트를 사용하면 이 작업을 제대로 수행하기가 점점 더 어려워집니다. 속도가 증가함에 따라 새로운 PR의 비율과 코드 양을 수동으로 철저하게 검토하는 것은 거의 불가능합니다. 다양한 공급업체의 여러 에이전트가 PRS의 버그, 보안 문제 및 아키텍처 문제를 검토하고 있습니다. 그러나 지점 보호는 유지되므로 초지능 에이전트가 PR의 최종 승인자가 되도록 허용했습니다.

MCP 응답 계약에 대한 주요 변경 사항을 찾은 후 에이전트가 풀 요청 4981에 대한 변경 사항을 요청하는 Slack 스레드

우리는 결과가 평범할 것이라고 절반 정도 예상했습니다. 결국 이러한 PR는 로컬 코딩 에이전트 검토, 테스트, 보안 검토, 외부 GitHubCopilot 및 CodeRabbit 검토를 통과하고 완전히 승인되었습니다. 하지만 우리 요원은 여전히 ​​PR에 구멍을 뚫었습니다. 우리가 놓친 정말 흥미로운 엣지 케이스, 보안, 소프트웨어 품질, 우리가 고려하지 않은 아키텍처 버그를 발견했습니다. 다른 모든 리뷰어와 동일한 모델을 사용하는데 왜 다른 리뷰어가 파악하지 못한 내용을 파악하는 걸까요?

에이전트가 업로드 크기 제한을 초과하는 풀 요청 1711을 거부한 후 수정 사항이 확인되면 이를 다시 승인하는 Slack 스레드

그것은 지식과 경험으로 귀결됩니다. Hermes Agent 하네스는 에이전트가 축적한 지식과 결합되어 이전에 볼 수 없었던 새로운 유형의 초지능 에이전트를 만듭니다. 그래서 우리는 이를 더 자세히 조사하여 시스템에서 작업하는 사람뿐만 아니라 덜 지능적인 다른 에이전트에 대한 참조 역할을 하도록 에이전트의 검토를 필수로 만들었습니다.

이제 이 에이전트는 이전에는 인간에게서만 보았던 비판적 사고를 제공할 수 있지만 실제 고객 데이터, 피드백, 코드 및 제품에 대한 깊은 이해를 바탕으로 뒷받침됩니다.

이를 확장하고 더 많은 데이터를 제공하고 하드웨어와 메모리를 확장하면 성능이 기하급수적으로 향상될 것입니다. 제 생각에는 모델들이 여전히 그것을 억제하고 있는 것 같아요. 아마도 GPT-6를 통해 이 게임의 다음 단계로 넘어갈 때 결과는 훨씬 더 흥미로울 것입니다. 더 많은 데이터가 축적되면 상담원에게 더 많은 작업을 제공하고 이를 더 신뢰하게 됩니다.

이것이 Karpathy의 Wiki 기반 제2뇌와 어떻게 다릅니까?

이것이 다른 접근 방식과 다른 점은 공유된 지식을 처리하는 대신 슈퍼 에이전트 지식이 로컬에 저장된다는 것입니다. 우리는 리포지토리에서 자체 메모리와 세계 이해를 유지하도록 요청할 수 있으며 이를 통해 복제하고 모니터링할 수 있지만 궁극적으로는 ~ 아니다 지식과 기술을 공유하고 협력할 수 있게 만드는 것입니다. 이는 도구 및 전 세계 액세스와 함께 귀하의 질문에 직접 답변할 수 있는 단일 지식 베이스입니다. 공유된 지식을 사용하여 에이전트에게 이를 알아내도록 요청하지 않고, 귀하 또는 귀하의 에이전트가 Superinelligent 에이전트에게 질문을 합니다. 놀랍게도 이는 에이전트의 액세스와 도달 범위를 지속적으로 확장하고 결과적으로 지식이나 지능이 저하되는 것을 아직 볼 수 없을 정도로 현재 우리에게 잘 작동하고 있습니다.

참고: 우리는 에이전트를 민감한 정보나 기능에 노출시키지 않습니다. 당사의 뱅킹, 청구 또는 청구 시스템에 직접 액세스할 수 없습니다. 또한 세상과 분리되어 이메일이나 외부 채널에 접근할 수 없습니다. 경험과 신뢰가 쌓이면 이러한 규제도 크게 해소되지 않을 것 같습니다.



|

Anima 팀은 디자인, 바이브 코딩, 그리고 AI 기반 UX 에이전트 및 플랫폼의 미래를 만들고 있습니다. 제품 업데이트, 워크플로우, 영감, 그리고 팀 인사이트를 공유합니다.