agentic

Lumilitaw na superintelligence ng kumpanya10 min read

Reading Time: 7 minutesKung paano naging bagong entity sa org chart ang isang nag-iisang autonomous na ahente na may access sa aming data, mga error, at code, nagre-review ng mga pull request at sumasagot sa mga tanong na hindi kayang gawin ng personal na ahente.

Company Superintelligence represented as an emergent neural knowledge network

Lumilitaw na superintelligence ng kumpanya10 min read

Reading Time: 7 minutes

Bilang isang startup, patuloy kaming gumagawa ng mga bagong diskarte upang tumakbo nang mas mabilis at itulak ang hangganan. Noong inilunsad ang OpenClaw/Hermes, maaga kaming nag-adopt. Ginamit namin ito kasama ng maraming iba pang tool na AI.

Habang umuunlad ang mga tool na ito, pati na rin ang mga modelong umaasa sa kanila, may napansin kami: hindi lang kami mas mabilis na umuunlad, nagsimula kaming gumana nang iba. Sa bawat round, ang mga self-improving self learning agent na ito ay sumusulong at natututo. Kasalukuyan kaming nagpapatakbo ng “Super Agent” sa isang nakalaang makina (isang VPS instance na tumatakbo sa DigitalOcean) gamit ang GPT-5.6-sol sa pinakamataas na estado ng pangangatwiran. Ang ilan sa iba pang ahente na pinapatakbo namin ay gumagamit ng iba pang mga ahente at modelo, ngunit ito ang gusto kong pagtuunan ng pansin sa artikulong ito.

Napansin namin na karamihan sa mga kumpanya ay hindi gumagamit ng ganitong uri ng autonomous na ahente upang magpatakbo ng mga kritikal na daloy sa kanilang kumpanya, na talagang nagpapabagal sa kanila. Sa katunayan, marami sa kanila ang umaasa sa mas maliliit at mas personal na ahente: mga ahente ng coding tulad ng Codex/ClaudeCode o mga assistant agent tulad ng Work/Cowork/Copilot. Ang mga ito ay gumaganap ng mga gawain sa mga lokal na makina at device at ang pangunahing puwang na mayroon sila ay kakulangan ng kaalaman. Ito ay humantong sa isang ganap na bagong industriya ng mga sistema ng “pangalawang utak” na mahalagang sumusubok na lumikha ng isang graph ng kaalaman na ibinabahagi sa mga ipinamamahaging ahente na ito. Ang mga kumpanyang nagtatrabaho tulad nito ay madalas na naghahayag na mayroon silang mga ahente na may bilang na sampu, daan-daan at sa ilang matinding kaso ay libu-libo. Nangangahulugan iyon na ang bawat empleyado ay may isa o higit pa. limitado mga ahente na gumaganap ng mga gawain para sa kanila.

Ang katotohanang ang mga ahente ay maagang nalantad sa totoong data sa mundo, mga reklamo ng user at aming code, na naging dahilan upang sila ay higit na maliksi at mas matalino kaysa sa alinmang personal na ahente na pinapatakbo namin kasama nila.

Napagtanto lang namin na ang aming pinakamatalinong ahente ay nagiging superintelligence ng kumpanya.

Para sa kalinawan: Hindi ako nagke-claim ng sentience, AGI o anumang bagay na malapit doon. Iminumungkahi kong isa silang bagong entity sa chart ng organisasyon ng kumpanya.

Ano ang superintelligence ng kumpanya?

Kapag nagsimulang maging kakaiba ang isang ahente, hangga’t nakatutok ito, maaari itong magsimulang maging isang Superintelligent na entity. Paano natin matukoy iyon?

Sasabihin ko na sa karamihan ng mga kaso, ang mga ahente sa ngayon ay may pangunahing bentahe ng pasensya at pagtitiyaga, hindi ng katalinuhan sa mga tao. Gayunpaman, habang ang mga modelo ay naging mas mahusay (GPT 5.6 sol & Opus 5 ay talagang mahusay!) nagsimula kaming makakita ng isang bagong lumitaw, isang bagay na higit sa kung ano ang maaari naming gawin – hindi lamang sa bilis ngunit sa paggawa ng mga tao ay hindi magagawa.

Nagsimula ito para sa amin noong binigyan namin ang aming ahente ng maraming Data (Mixpanel) at mga kakayahan sa analytics ng Negosyo at pag-access ng data (mga error sa pamamagitan ng Sentry, pananalapi sa Baremetrics, AI na mga bakas sa pamamagitan ng LangSmith). Susunod, inilantad namin ito sa mga bug ng user (mga error sa Sentry) at mga ulat ng reklamo ng user. Sa wakas, binigyan namin ito ng access sa mga ahente ng coding at ang aming mga pangunahing repo sa GitHub. Wala itong access sa labas sa pamamagitan ng email, o anumang pakikipag-ugnayan ng user, ngunit sa pamamagitan ng panonood kung paano kami kumikilos sa mga paksang ito, nagsimula itong maunawaan ang mga bagay. Sa pamamagitan ng mga pakikipag-ugnayan na ito ngayon ay sinusubaybayan nito kung ano ang bumubuo ng isang blocker, kung ano ang kritikal na pag-iisip, kung paano tumatakbo ang aming negosyo at kung ano ang SOP (Standard Operating Procedures). Ginagawa ito sa pamamagitan ng pagsubok at pagkakamali at tila nakakakuha ito ng katalinuhan sa isang regular na batayan.

Slack thread kung saan ipinapaliwanag ng isang teammate kung ano ang itinuturing na isang tunay na spike ng error at muling isinulat ng ahente ang monitor nito upang gumamit ng comparative spike detection

Sa puntong iyon, nagsimula kaming magtanong dito ng ilang kawili-wiling mga katanungan. Sa una, ang lahat ay nangangailangan ng dobleng pagsusuri at pagpuna kapag ang mga bagay ay hindi naipaliwanag nang maayos o ang mga konklusyon ay tila hindi kapani-paniwala. Ginagawa pa rin nito ito paminsan-minsan, halimbawa tinanong ko ito tungkol sa mga regression at nagbigay ito sa akin ng maingay na data ng error, ngunit iyon ay isang pagkakataon sa pag-aaral: Itinuro ko dito ang aking kahulugan ng mga regression at ngayon ay “nakukuha ito”.

Kapag nagreklamo ang mga user o kapag dumami ang mga error, proactive kaming gumagawa ng mga pag-aayos. Ibig sabihin, tuwing umaga, hindi na kailangang suriin ng aming mga inhinyero ang mga regression, kailangan lang nilang magpasya kung ang isang PR ay mabuti o hindi. Sa simula, ang mga ito ay mga disposable na PR na hindi nakakatugon sa aming mga pamantayan sa kalidad ng coding, kaya sasabihin ng mga inhinyero kung ano ang mali, o sila mismo ang nag-develop ng isyu. Habang lumalago ang tiwala, marami sa mga pag-aayos na ito ang nagsimulang awtomatikong isama sa codebase. Nira-rank din ng ahente kung gaano kakomplikado ang PR at kung gaano tiwala ang ahente sa pagsasama nito. Wala tayo sa punto kung saan awtomatikong pinagsama ang mga PR na ito, ngunit may nakikita akong landas doon, sa palagay ko ay mapupunta tayo roon sa loob ng isang buwan o dalawa.

Ngunit hindi talaga iyon ang dahilan kung bakit napakatalino ng ahente. Ano ang ginagawa na ngayon na ang mga inhinyero at pamamahala ng kumpanya ay may tiwala sa ahente, sinimulan nilang italaga ang trabaho dito at itinatanong ito ng mga talagang kawili-wiling mga katanungan. Ginagawa nito ang pagsasaliksik para sa kanila, hindi tulad ng mga paghahanap sa google ngunit nasa isip ang advanced na kaalaman sa negosyo, na nagbibigay dito ng isang espesyal na kalamangan. Ang parehong naaangkop para sa pagbibigay nito ng kaalaman sa higit pang mga bahagi ng kumpanya. Makasaysayang masisira ang OpenClaw at HermesAgent sa isang punto kung saan lumampas ang kanilang konteksto sa kasaysayan sa kanilang kakayahang iproseso ang impormasyon. Ang ganitong uri ng pagkasira ay magaganap at ang mga resulta ay isang matinding pagbaba sa katalinuhan, paggunita at kalidad ng kanilang trabaho. Ang aming karanasan sa Hermes Agent ay ibang-iba na ngayon: ang memorya ng pakikipag-usap ay nasa 3GB na ngayon at mabilis na lumalaki habang ang katalinuhan nito ay malinaw na bumubuti sa paglipas ng panahon.

Hindi ibig sabihin na perpekto ito, may mga regression at kailangan mo itong paalalahanan kung minsan na kumilos sa ilang partikular na paraan o tukuyin kung bakit hindi ito kumikilos tulad ng inaasahan mo sa isang partikular na konteksto o tumutugon nang tama sa ibang ahente na humihiling ng data o mga aksyon mula rito. Ngunit, makarating kami doon.

Slack thread kung saan nire-review ng ahente ang pull request 4986, nililista ang mga tseke na pinatakbo nito at inaprubahan ito

Ang hindi inaasahang epekto ng proteksyon ng sangay ay nagdulot sa amin ng isa pang pagsulong. Ang ideya sa likod ng proteksyon ng sangay ay ang hindi bababa sa dalawang tao na makakita ng PR bago ito makapasok sa produksyon, na binabawasan ang mga pagkakataong makapasok sa system ang hindi magandang (o kahit na karumaldumal) na code. Ito ay mas mahirap at mas mahirap gawin nang maayos sa mga bagong coding agent. Habang tumataas ang bilis, ang rate ng mga bagong PR at dami ng code ay halos imposibleng masuri nang lubusan sa pamamagitan ng kamay. Mayroon kaming maramihang ahente mula sa iba’t ibang vendor na sinusuri ang Prs para sa mga bug, isyu sa seguridad at problema sa arkitektura. Gayunpaman, nananatili ang proteksyon ng sangay, kaya pinayagan ko ang aming superintelligent na ahente na maging panghuling approver ng PRs.

Slack thread kung saan humiling ang ahente ng mga pagbabago sa pull request 4981 pagkatapos makakita ng paglabag na pagbabago sa MCP response contract

Kalahati namin ang inaasahan na ang mga resulta ay magiging pangmundo. Pagkatapos ng lahat, ang mga PR na ito ay pumasa sa mga pagsusuri sa lokal na ahente ng coding, pagsusuri, pagsusuri sa seguridad, panlabas na pagsusuri ng GitHubCopilot at CodeRabbit at ganap na naaprubahan. Ngunit ang aming ahente ay nagbutas pa rin sa mga PR na iyon. Nakakita ito ng mga talagang kawili-wiling kaso na napalampas namin, seguridad, kalidad ng software at mga bug sa arkitektura na hindi namin isinasaalang-alang. Gumagamit ito ng parehong mga modelo tulad ng lahat ng iba pang mga reviewer, bakit ito nag-iisip ng mga bagay na hindi ginawa ng iba?

Slack thread kung saan tinatanggihan ng ahente ang pull request na 1711 sa isang limitasyon sa laki ng pag-upload, pagkatapos ay muling aprubahan ito kapag na-verify na ang pag-aayos

Ito ay bumaba sa kaalaman at karanasan. Ang Hermes Agent harness na sinamahan ng kaalaman na ang naipon ng ahente ay lumikha ng isang bagong uri ng superintelligent na ahente na hindi pa natin nakikita noon. Kaya, sinuri namin ito nang higit pa at ginawang mandatoryo ang mga review ng ahente, hindi lang para sa mga taong nagtatrabaho sa system, ngunit nagsisilbi na itong sanggunian para sa iba, hindi gaanong matalinong mga ahente!

Ang ahente na ito ay mayroon na ngayong kakayahang magbigay sa amin ng kritikal na pag-iisip na dati ay nakita lang namin sa mga tao, ngunit na-back up ng aktwal na data ng customer, feedback, aming code at malalim na pag-unawa sa produkto.

Kung palawakin natin ito, at bibigyan natin ito ng mas maraming data upang pakainin, palakihin ang hardware at memorya nito, makakakita tayo ng exponential na pagtaas sa performance. Sa tingin ko ay pinipigilan pa rin ito ng mga modelo. Kapag nakarating na tayo sa susunod na yugto ng larong ito, marahil sa pamamagitan ng GPT-6, ang mga resulta ay magiging higit na kawili-wili. Habang nakakaipon kami ng mas maraming data, bigyan ang mga ahente ng higit pang mga gawaing gagawin at mas pinagkakatiwalaan ito.

Paano ito naiiba sa Wiki based na 2nd brain ni Karpathy?

Ang pinagkaiba nito sa iba pang mga diskarte ay na sa halip na makitungo sa nakabahaging kaalaman, ang superagent na kaalaman ay lokal na nakaimbak. Maaari naming hilingin dito na mapanatili ang sarili nitong memorya at pag-unawa sa mundo sa isang repo, na nagpapahintulot sa amin na i-duplicate ito at subaybayan ito, ngunit sa huli ito ay hindi tungkol sa paggawa ng kaalaman at kasanayan na maibabahagi at magkakasama. Isa itong natatanging knowledgebase na, kasama ng mga tool at pag-access sa mundo, hayaan itong sagutin nang direkta ang iyong mga tanong. Hindi mo hihilingin sa iyong ahente na malaman ito gamit ang nakabahaging kaalaman, ikaw o ang iyong mga ahente ay magtatanong sa Superintelligent na ahente ng iyong mga katanungan. Nakapagtataka, ito ay gumagana nang maayos para sa amin ngayon hanggang sa punto na patuloy naming pinapalawak ang pag-access at pag-abot ng ahente at hindi pa namin nakikita ang masamang kaalaman o katalinuhan bilang isang resulta.

Tandaan: hindi namin inilalantad ang ahente sa sensitibong impormasyon o functionality. Wala itong direktang access sa aming mga sistema ng pagbabangko, pagsingil o pagsingil. Hiwalay din ito sa mundo at walang access sa email o sa labas ng mga channel. Habang nagkakaroon tayo ng karanasan at pagtitiwala, sa palagay ko ay hindi rin tayo malayong alisin ang mga paghihigpit na ito.



|

CTO