agentic

Perisikan syarikat yang muncul8 min read

Reading Time: 6 minutesCara ejen autonomi tunggal dengan akses kepada data, ralat dan kod kami menjadi entiti baharu pada carta organisasi, menyemak permintaan tarik dan menjawab soalan yang tidak boleh dilakukan oleh ejen peribadi.

Company Superintelligence represented as an emergent neural knowledge network

Perisikan syarikat yang muncul8 min read

Reading Time: 6 minutes

Sebagai permulaan, kami sentiasa mengusahakan teknik baharu untuk berjalan lebih pantas dan menolak sempadan. Apabila OpenClaw/Hermes dilancarkan, kami adalah pengguna awal. Kami menggunakannya bersama dengan banyak alat AI yang lain.

Memandangkan alatan ini, serta model yang mereka andalkan, semakin maju, kami dapati sesuatu: kami bukan sahaja maju dengan lebih pantas, kami telah mula berfungsi secara berbeza. Dengan setiap pusingan, agen pembelajaran kendiri yang meningkatkan diri ini semakin maju dan belajar. Kami sedang menjalankan “Ejen Super” pada mesin khusus (contoh VPS yang dijalankan pada DigitalOcean) menggunakan GPT-5.6-sol pada keadaan penaakulan tertinggi. Beberapa ejen lain yang kami jalankan menggunakan abah-abah dan model ejen lain, tetapi ini adalah yang saya ingin fokuskan dalam artikel ini.

Kami mendapati bahawa kebanyakan syarikat tidak menggunakan jenis ejen autonomi ini untuk menjalankan aliran kritikal dalam syarikat mereka, yang benar-benar melambatkan mereka. Malah, kebanyakan mereka bergantung pada ejen yang lebih kecil dan lebih peribadi: ejen pengekodan seperti Codex/ClaudeCode atau ejen pembantu seperti Work/Cowork/Copilot. Ini melaksanakan tugas pada mesin dan peranti tempatan dan jurang utama yang mereka ada ialah kekurangan pengetahuan. Ini membawa kepada industri baharu sistem “otak kedua” yang pada asasnya cuba mencipta graf pengetahuan yang dikongsi di kalangan ejen yang diedarkan ini. Syarikat yang bekerja seperti ini sering mengisytiharkan mereka mempunyai ejen berjumlah puluhan, ratusan dan dalam beberapa kes yang melampau ribuan. Ini pada asasnya bermakna setiap pekerja mempunyai satu atau lebih terhad ejen menjalankan tugas untuk mereka.

Hakikat bahawa ejen telah didedahkan awal kepada data dunia sebenar, aduan pengguna dan kod kami, menjadikan mereka secara mendadak lebih tangkas dan lebih bijak daripada mana-mana ejen peribadi yang kami jalankan bersama mereka.

Kami baru menyedari bahawa ejen kami yang paling bijak sedang menjadi superintelligence syarikat.

Demi kejelasan: Saya tidak menuntut perasaan, AGI atau apa-apa yang hampir dengan itu. Saya mencadangkan mereka adalah entiti baharu dalam carta org syarikat.

Apakah superintelligence syarikat?

Apabila seorang ejen mula menonjol, selagi ia fokus, ia boleh mula menjadi entiti Superintelligent. Bagaimana kita menentukannya?

Saya akan mengatakan bahawa dalam kebanyakan kes, ejen sekarang mempunyai kelebihan utama iaitu kesabaran dan ketekunan, bukan kecerdasan berbanding manusia. Walau bagaimanapun, apabila model menjadi lebih baik (GPT 5.6 sol & Opus 5 benar-benar bagus!) kami telah mula melihat sesuatu yang baru muncul, sesuatu yang melebihi apa yang boleh kami lakukan – bukan sahaja dalam kelajuan tetapi dalam melakukan manusia tidak boleh lakukan.

Ia bermula untuk kami apabila kami memberikan ejen kami banyak keupayaan Data (Mixpanel) dan analisis Perniagaan dan akses data (ralat melalui Sentry, kewangan dalam Baremetrics, AI jejak melalui LangSmith). Seterusnya, kami mendedahkannya kepada pepijat pengguna (ralat Sentry) dan laporan aduan pengguna. Akhirnya, kami memberikannya akses kepada ejen pengekodan dan repo utama kami di GitHub. Ia tidak mempunyai akses luar melalui e-mel, atau sebarang interaksi pengguna, tetapi melalui menonton bagaimana kami berkelakuan pada topik ini, ia mula memahami perkara. Melalui interaksi ini ia kini memantau apa yang menjadi penyekat, apakah pemikiran kritis, bagaimana perniagaan kita berjalan dan apakah SOP (Standard Operating Procedures). Ia melakukan ini melalui percubaan dan kesilapan dan ia nampaknya mendapat kecerdasan secara tetap.

Benang kendur di mana rakan sepasukan menerangkan perkara yang dikira sebagai lonjakan ralat sebenar dan ejen menulis semula monitornya untuk menggunakan pengesanan lonjakan perbandingan

Pada ketika itu, kami mula bertanya beberapa soalan yang menarik. Pada mulanya, segala-galanya memerlukan pemeriksaan dan kritikan semula apabila perkara tidak dijelaskan dengan betul atau kesimpulannya terdengar mencurigakan. Ia masih melakukan ini dari semasa ke semasa, contohnya saya bertanya tentang regresi dan ia memberi saya data ralat yang bising, tetapi itu adalah peluang pembelajaran: Saya mengajarnya definisi regresi saya dan kini ia “mendapatnya”.

Apabila pengguna mengadu atau apabila ralat meningkat, kami secara proaktif menghasilkan pembetulan. Ini bermakna setiap pagi, jurutera kami tidak perlu menyemak regresi, mereka hanya perlu memutuskan sama ada PR adalah baik atau tidak. Pada mulanya, ini adalah PR pakai buang yang tidak memenuhi standard kualiti pengekodan kami, jadi jurutera akan memberitahunya apa yang salah, atau hanya membangunkan semula isu itu sendiri. Apabila kepercayaan semakin meningkat, banyak pembetulan ini mula digabungkan ke dalam pangkalan kod secara automatik. Ejen juga menilai betapa kompleksnya PR dan sejauh mana keyakinan ejen untuk menggabungkannya. Kami tidak berada pada titik di mana PR ini digabungkan secara automatik, tetapi saya melihat laluan di sana, saya menganggap kami akan berada di sana dalam satu atau dua bulan.

Tetapi itu sebenarnya bukan yang menjadikan ejen itu sangat bijak. Apa yang boleh dilakukan ialah sekarang bahawa jurutera dan pengurusan syarikat mempunyai kepercayaan terhadap ejen, mereka mula mewakilkan kerja kepadanya dan bertanya soalan yang sangat menarik. Ia melakukan penyelidikan untuk mereka, bukan seperti carian google tetapi dengan pengetahuan lanjutan tentang perniagaan dalam fikiran, yang memberikan kelebihan istimewa. Perkara yang sama berlaku untuk memberinya pengetahuan tentang lebih banyak bahagian syarikat. OpenClaw dan HermesAgent dari segi sejarah akan rosak pada satu ketika di mana konteks sejarah mereka melebihi keupayaan mereka untuk memproses maklumat. Jenis kerosakan itu akan berlaku dan hasilnya adalah penurunan drastik dalam kecerdasan, ingatan dan kualiti kerja mereka. Pengalaman kami dengan Hermes Agent agak berbeza sekarang: memori perbualan kini berada pada 3GB dan berkembang dengan pesat sementara kecerdasannya jelas bertambah baik dari semasa ke semasa.

Itu bukan untuk mengatakan ia sempurna, terdapat regresi dan anda perlu kadangkala mengingatkannya untuk berkelakuan dengan cara tertentu atau mengenal pasti sebab ia tidak berkelakuan seperti yang anda harapkan dalam konteks tertentu atau bertindak balas dengan betul kepada ejen lain yang meminta data atau tindakan daripadanya. Tetapi, kami sampai ke sana.

Urutan kendur tempat ejen menyemak permintaan tarik 4986, menyenaraikan semakan yang dijalankan dan meluluskannya

Kesan sampingan perlindungan cawangan yang tidak dijangka membawa kami satu lagi kemajuan. Idea di sebalik perlindungan cawangan ialah sekurang-kurangnya dua orang melihat PR sebelum ia mula dikeluarkan, mengurangkan kemungkinan kod buruk (atau malah jahat) masuk ke dalam sistem. Ini lebih sukar dan lebih sukar untuk dilakukan dengan betul dengan ejen pengekodan baharu. Apabila halaju meningkat, kadar PR baharu dan kuantiti kod hampir mustahil untuk disemak secara menyeluruh dengan tangan. Kami mempunyai berbilang ejen daripada vendor berbeza menyemak Prs untuk pepijat, isu keselamatan dan masalah seni bina. Walau bagaimanapun, perlindungan cawangan kekal, jadi saya membenarkan ejen superintelligent kami menjadi kelulusan akhir PRs.

Benang kendur di mana ejen meminta perubahan pada permintaan tarik 4981 selepas mendapati perubahan pecah pada kontrak respons MCP

Kami separuh menjangkakan bahawa hasilnya akan menjadi biasa. Lagipun, PR ini lulus ulasan ejen pengekodan tempatan, ujian, ulasan keselamatan, ulasan GitHubCopilot dan CodeRabbit luaran dan telah diluluskan sepenuhnya. Tetapi ejen kami masih membuat lubang pada PR tersebut. Ia menemui kes kelebihan yang sangat menarik yang kami terlepas, keselamatan, kualiti perisian dan pepijat seni bina yang tidak kami pertimbangkan. Ia menggunakan model yang sama seperti semua pengulas lain, mengapa ia memikirkan perkara yang tidak dilakukan oleh yang lain?

Urutan kendur yang mana ejen menolak permintaan tarik 1711 melebihi had saiz muat naik, kemudian meluluskannya semula setelah pembetulan disahkan

Ia datang kepada pengetahuan dan pengalaman. Harness Hermes Agent digabungkan dengan pengetahuan bahawa ejen terkumpul mencipta jenis ejen superintelligent baharu yang belum pernah kami lihat sebelum ini. Jadi, kami meneroka perkara ini dengan lebih lanjut dan mewajibkan ulasan ejen, bukan sahaja untuk manusia yang bekerja pada sistem, tetapi ia kini bertindak sebagai rujukan untuk ejen lain yang kurang bijak!

Ejen ini kini mempunyai keupayaan untuk memberi kita pemikiran kritis yang sebelum ini hanya kita lihat pada manusia, tetapi disokong oleh data pelanggan sebenar, maklum balas, kod kami dan pemahaman yang mendalam tentang produk.

Jika kita mengembangkan perkara ini, dan memberikannya lebih banyak data untuk dimakan, menskalakan perkakasan dan memorinya, kita akan melihat peningkatan eksponen dalam prestasi. Saya fikir model masih menahannya. Apabila kita sampai ke fasa seterusnya permainan ini, mungkin melalui GPT-6, hasilnya akan menjadi lebih menarik secara dramatik. Semasa kami mengumpul lebih banyak data, berikan ejen lebih banyak tugas untuk dilakukan dan lebih mempercayainya.

Bagaimanakah ini berbeza daripada otak ke-2 berasaskan Wiki Karpathy?

Apa yang membezakannya daripada pendekatan lain ialah daripada menangani pengetahuan yang dikongsi, pengetahuan superagen disimpan secara tempatan. Kita boleh memintanya untuk mengekalkan ingatan dan pemahaman dunianya sendiri dalam repo, yang membolehkan kita menduplikasinya dan memantaunya, tetapi akhirnya ia adalah bukan tentang menjadikan pengetahuan dan kemahiran boleh dikongsi dan bekerjasama. Ia adalah pangkalan pengetahuan tunggal yang, bersama-sama dengan alatan dan akses dunia, biarkan ia menjawab soalan anda secara langsung. Anda tidak meminta ejen anda memikirkannya menggunakan pengetahuan yang dikongsi, sama ada anda atau ejen anda bertanya kepada ejen Superintelligent soalan anda. Yang menghairankan, ini berfungsi dengan baik untuk kami sekarang sehingga kami terus mengembangkan akses dan capaian ejen dan kami masih belum melihat pengetahuan atau kecerdasan yang terdegradasi sebagai hasilnya.

Nota: kami tidak mendedahkan ejen kepada maklumat atau fungsi sensitif. Ia tidak mempunyai akses terus kepada sistem perbankan, pengecajan atau pengebilan kami. Ia juga diasingkan daripada dunia dan tidak mempunyai akses kepada e-mel atau saluran luar. Sambil kita memperoleh pengalaman dan kepercayaan, saya rasa kita tidak jauh dari menarik balik sekatan ini.



|

CTO