Επείγουσα εταιρική υπερκατασκοπεία2 min read
Reading Time: 6 minutesΩς startup, εργαζόμαστε συνεχώς πάνω σε νέες τεχνικές για να τρέχουμε πιο γρήγορα και να ξεπερνάμε τα σύνορα. Όταν κυκλοφόρησε το OpenClaw/Hermes, ήμασταν πρώιμος υιοθετητής. Το χρησιμοποιήσαμε μαζί με πολλά άλλα εργαλεία AI.
Καθώς αυτά τα εργαλεία, καθώς και τα μοντέλα στα οποία βασίζονται, προχωρούσαν, παρατηρήσαμε κάτι: όχι απλώς προχωράμε πιο γρήγορα, αλλά αρχίσαμε να εργαζόμαστε διαφορετικά. Με κάθε γύρο, αυτοί οι αυτοβελτιωτικοί παράγοντες αυτομάθησης προχωρούν και μαθαίνουν. Αυτήν τη στιγμή εκτελούμε έναν “Super Agent” σε ένα αποκλειστικό μηχάνημα (ένα παράδειγμα VPS που εκτελείται σε DigitalOcean) χρησιμοποιώντας το GPT-5.6-sol στην υψηλότερη κατάσταση συλλογισμού. Ορισμένοι από τους άλλους πράκτορες που εκτελούμε χρησιμοποιούν άλλες πλεξούδες και μοντέλα πρακτόρων, αλλά σε αυτό θα ήθελα να εστιάσω σε αυτό το άρθρο.
Παρατηρήσαμε ότι οι περισσότερες εταιρείες δεν χρησιμοποιούν αυτό το είδος αυτόνομου πράκτορα για να τρέξουν κρίσιμες ροές στην εταιρεία τους, γεγονός που τις επιβραδύνει πραγματικά. Στην πραγματικότητα, πολλοί από αυτούς βασίζονται σε μικρότερους, πιο προσωπικούς πράκτορες: πράκτορες κωδικοποίησης όπως το Codex/ClaudeCode ή βοηθούς πράκτορες όπως το Work/Cowork/Copilot. Αυτά εκτελούν εργασίες σε τοπικές μηχανές και συσκευές και το κύριο κενό που έχουν είναι η έλλειψη γνώσης. Αυτό οδήγησε σε μια εντελώς νέα βιομηχανία συστημάτων «δεύτερου εγκεφάλου» που ουσιαστικά προσπαθούν να δημιουργήσουν ένα γράφημα γνώσης που μοιράζεται μεταξύ αυτών των κατανεμημένων πρακτόρων. Οι εταιρείες που εργάζονται με αυτόν τον τρόπο συχνά δηλώνουν ότι έχουν πράκτορες που αριθμούνται σε δεκάδες, εκατοντάδες και σε ορισμένες ακραίες περιπτώσεις χιλιάδες. Αυτό ουσιαστικά σημαίνει ότι κάθε εργαζόμενος έχει έναν ή περισσότερους περιωρισμένος πράκτορες που εκτελούν καθήκοντα για αυτούς.
Το γεγονός ότι οι πράκτορες εκτέθηκαν νωρίς σε δεδομένα του πραγματικού κόσμου, σε παράπονα χρηστών και στον κώδικά μας, τους έκανε δραματικά πιο ευέλικτους και πιο έξυπνους από οποιονδήποτε προσωπικό πράκτορα που τρέχουμε μαζί τους.
Μόλις συνειδητοποιήσαμε ότι οι πιο έξυπνοι πράκτορες μας γίνονται υπερκατανοήσεις εταιρείας.
Για λόγους σαφήνειας: Δεν διεκδικώ συναίσθημα, AGI ή κάτι αντίστοιχο. Προτείνω ότι είναι μια ολοκαίνουργια οντότητα στο οργανόγραμμα της εταιρείας.
Τι είναι η εταιρική υπερκατασκοπεία;
Όταν ένας πράκτορας αρχίζει να ξεχωρίζει, εφόσον είναι εστιασμένος, μπορεί να αρχίσει να γίνεται Υπερέξυπνη οντότητα. Πώς το ορίζουμε αυτό;
Θα έλεγα ότι στις περισσότερες περιπτώσεις, οι πράκτορες αυτή τη στιγμή έχουν πρωτίστως το πλεονέκτημα της υπομονής και της επιμονής, όχι της ευφυΐας έναντι των ανθρώπων. Ωστόσο, καθώς τα μοντέλα έγιναν καλύτερα (το GPT 5.6 sol και το Opus 5 είναι πολύ καλά!) αρχίσαμε να βλέπουμε κάτι νέο να αναδύεται, κάτι που ξεπερνά αυτό που θα μπορούσαμε να κάνουμε – όχι μόνο σε ταχύτητα, αλλά και σε πράξεις που δεν μπορούν να κάνουν οι άνθρωποι.
Ξεκίνησε για εμάς όταν δώσαμε στον αντιπρόσωπό μας άφθονες δυνατότητες δεδομένων (Mixpanel) και Business analytics και πρόσβαση σε δεδομένα (λάθη μέσω Sentry, οικονομικά στο Baremetrics, AI ίχνη μέσω του LangSmith). Στη συνέχεια, το εκθέσαμε σε σφάλματα χρήστη (λάθη Sentry) και αναφορές παραπόνων χρηστών. Τέλος, του δώσαμε πρόσβαση σε πράκτορες κωδικοποίησης και στα κύρια repos μας στο GitHub. Δεν έχει εξωτερική πρόσβαση μέσω email ή οποιασδήποτε αλληλεπίδρασης με τον χρήστη, αλλά παρακολουθώντας πώς συμπεριφερόμαστε σε αυτά τα θέματα, άρχισε να κατανοεί τα πράγματα. Μέσω αυτών των αλληλεπιδράσεων παρακολουθεί τώρα τι αποτελεί αποκλεισμό, τι είναι η κριτική σκέψη, πώς λειτουργεί η επιχείρησή μας και τι είναι οι SOP (Τυπικές Διαδικασίες Λειτουργίας). Το κάνει αυτό μέσω δοκιμής και λάθους και φαίνεται να αποκτά ευφυΐα σε τακτική βάση.
Σε εκείνο το σημείο, αρχίσαμε να του κάνουμε μερικές ενδιαφέρουσες ερωτήσεις. Στην αρχή, όλα απαιτούσαν διπλό έλεγχο και κριτική όταν τα πράγματα δεν εξηγούνταν σωστά ή τα συμπεράσματα ακούγονταν ψάρια. Εξακολουθεί να το κάνει αυτό κατά καιρούς, για παράδειγμα, το ρώτησα για παλινδρομήσεις και μου έδωσε θορυβώδη δεδομένα σφαλμάτων, αλλά αυτή είναι μια ευκαιρία εκμάθησης: του έμαθα τον ορισμό μου για τις παλινδρομήσεις και τώρα «τα παίρνει».
Όταν οι χρήστες παραπονούνται ή όταν τα σφάλματα αυξάνονται, δημιουργούμε προληπτικά διορθώσεις. Αυτό σημαίνει ότι κάθε πρωί, οι μηχανικοί μας δεν χρειάζεται να ελέγχουν για παλινδρομήσεις, απλά πρέπει να αποφασίσουν εάν ένα PR είναι καλό ή όχι. Στην αρχή, αυτά ήταν PR μιας χρήσης που δεν πληρούσαν τα πρότυπα ποιότητας κωδικοποίησης μας, οπότε οι μηχανικοί θα του έλεγαν τι ήταν λάθος ή απλώς ανέπτυξαν ξανά το πρόβλημα οι ίδιοι. Καθώς αυξανόταν η εμπιστοσύνη, πολλές από αυτές τις διορθώσεις άρχισαν να συγχωνεύονται αυτόματα στη βάση κώδικα. Ο πράκτορας κατατάσσει επίσης πόσο πολύπλοκο είναι το PR και πόσο σίγουρος είναι ο πράκτορας για τη συγχώνευσή του. Δεν βρισκόμαστε σε ένα σημείο όπου αυτά τα PR συγχωνεύονται αυτόματα, αλλά βλέπω μια διαδρομή εκεί, υποθέτω ότι θα είμαστε εκεί σε έναν ή δύο μήνες.
Αλλά αυτό δεν είναι πραγματικά που κάνει τον πράκτορα εξαιρετικά έξυπνο. Αυτό που κάνει είναι ότι τώρα που οι μηχανικοί και η διοίκηση της εταιρείας έχουν εμπιστοσύνη στον πράκτορα, αρχίζουν να του αναθέτουν δουλειά και να του κάνουν πραγματικά ενδιαφέρουσες ερωτήσεις. Κάνει την έρευνα για αυτούς, όχι όπως οι αναζητήσεις στο google, αλλά έχοντας κατά νου την προηγμένη γνώση της επιχείρησης, που της δίνει ένα ιδιαίτερο πλεονέκτημα. Το ίδιο ισχύει για την παροχή γνώσης περισσότερων τμημάτων της εταιρείας. Τα OpenClaw και HermesAgent θα κατέρρεαν ιστορικά σε κάποιο σημείο όπου το ιστορικό τους πλαίσιο υπερέβαινε την ικανότητά τους να επεξεργάζονται τις πληροφορίες. Αυτός ο τύπος βλάβης θα συνέβαινε και τα αποτελέσματα ήταν μια δραστική πτώση στη νοημοσύνη, την ανάμνηση και την ποιότητα της δουλειάς τους. Η εμπειρία μας με το Hermes Agent είναι αρκετά διαφορετική τώρα: η μνήμη συνομιλίας είναι τώρα στα 3 GB και αυξάνεται εκθετικά, ενώ η ευφυΐα της βελτιώνεται σαφώς με την πάροδο του χρόνου.
Αυτό δεν σημαίνει ότι είναι τέλειο, υπάρχουν παλινδρομήσεις και πρέπει μερικές φορές να του υπενθυμίζετε να συμπεριφέρεται με συγκεκριμένους τρόπους ή να προσδιορίζετε γιατί δεν συμπεριφέρεται όπως περιμένατε σε ένα συγκεκριμένο πλαίσιο ή δεν ανταποκρίνεται σωστά σε έναν άλλο πράκτορα που ζητά δεδομένα ή ενέργειες από αυτόν. Όμως, φτάνουμε εκεί.
Μια απροσδόκητη παρενέργεια της προστασίας κλαδιών μας έφερε άλλη μια πρόοδο. Η ιδέα πίσω από την προστασία του κλάδου είναι ότι τουλάχιστον δύο άτομα βλέπουν ένα PR πριν μπει στην παραγωγή, μειώνοντας τις πιθανότητες να μπει κακός (ή ακόμη και κακός) κώδικας στο σύστημα. Αυτό είναι όλο και πιο δύσκολο να γίνει σωστά με τους νέους πράκτορες κωδικοποίησης. Καθώς η ταχύτητα αυξάνεται, ο ρυθμός των νέων PR και η ποσότητα του κώδικα είναι σχεδόν αδύνατο να αναθεωρηθούν διεξοδικά με το χέρι. Έχουμε πολλούς πράκτορες από διαφορετικούς προμηθευτές που εξετάζουν το Prs για σφάλματα, ζητήματα ασφάλειας και αρχιτεκτονικά προβλήματα. Ωστόσο, η προστασία διακλάδωσης παραμένει, επομένως επέτρεψα στον υπερέξυπνο πράκτορά μας να είναι ο τελικός εγκριτής των PR.
Κατά το ήμισυ περιμέναμε ότι τα αποτελέσματα θα ήταν εγκόσμια. Εξάλλου, αυτά τα PR πέρασαν αξιολογήσεις τοπικού παράγοντα κωδικοποίησης, δοκιμές, αξιολογήσεις ασφαλείας, εξωτερικές κριτικές GitHubCopilot και CodeRabbit και εγκρίθηκαν πλήρως. Αλλά ο πράκτοράς μας εξακολουθούσε να ανοίγει τρύπες σε αυτά τα PR. Βρήκε πραγματικά ενδιαφέροντα περιστατικά αιχμής που χάσαμε, ασφάλεια, ποιότητα λογισμικού και αρχιτεκτονικά σφάλματα που δεν λάβαμε υπόψη. Χρησιμοποιεί τα ίδια μοντέλα με όλους τους άλλους κριτικούς, γιατί ανακαλύπτει πράγματα που δεν ήταν οι άλλοι;
Έχει να κάνει με τη γνώση και την εμπειρία. Η πλεξούδα Hermes Agent σε συνδυασμό με τη γνώση ότι συσσωρεύτηκε ο παράγοντας δημιουργεί έναν νέο τύπο υπερέξυπνου παράγοντα που δεν έχουμε ξαναδεί. Έτσι, το εξερευνήσαμε περαιτέρω και κάναμε υποχρεωτικές τις κριτικές του πράκτορα, όχι μόνο για τους ανθρώπους που εργάζονται στο σύστημα, αλλά τώρα λειτουργεί ως αναφορά για άλλους, λιγότερο έξυπνους πράκτορες!
Αυτός ο αντιπρόσωπος έχει τώρα τη δυνατότητα να μας δίνει κριτική σκέψη που παλαιότερα βλέπαμε μόνο σε ανθρώπους, αλλά υποστηρίζεται από πραγματικά δεδομένα πελατών, σχόλια, τον κώδικά μας και βαθιά κατανόηση του προϊόντος.
Εάν επεκταθούμε σε αυτό και του δώσουμε περισσότερα δεδομένα για τροφοδοσία, κλιμακώσουμε το υλικό και τη μνήμη του, θα δούμε μια εκθετική αύξηση στην απόδοση. Νομίζω ότι τα μοντέλα το κρατούν ακόμα πίσω. Όταν φτάσουμε στην επόμενη φάση αυτού του παιχνιδιού, ίσως μέσω του GPT-6, τα αποτελέσματα θα είναι δραματικά πιο ενδιαφέροντα. Καθώς συγκεντρώνουμε περισσότερα δεδομένα, δίνουμε στους πράκτορες περισσότερες εργασίες να κάνουν και εμπιστεύονται τα περισσότερα.
Σε τι διαφέρει αυτό από τον δεύτερο εγκέφαλο του Karpathy που βασίζεται στο Wiki;
Αυτό που το κάνει να διαφέρει από άλλες προσεγγίσεις είναι ότι αντί να ασχολείται με την κοινή γνώση, η γνώση των υπερπρακτόρων αποθηκεύεται τοπικά. Μπορούμε να του ζητήσουμε να διατηρήσει τη δική του μνήμη και την κατανόηση του κόσμου σε ένα repo, το οποίο μας επιτρέπει να το αντιγράψουμε και να το παρακολουθήσουμε, αλλά τελικά είναι δεν για τη δυνατότητα ανταλλαγής και συνεργασίας των γνώσεων και των δεξιοτήτων. Είναι μια μοναδική βάση γνώσεων που, μαζί με τα εργαλεία και την παγκόσμια πρόσβαση, την αφήνουν να απαντήσει άμεσα στις ερωτήσεις σας. Δεν ζητάτε από τον πράκτορά σας να το καταλάβει χρησιμοποιώντας την κοινή γνώση, είτε εσείς είτε οι πράκτορές σας κάνετε τις ερωτήσεις σας στον πράκτορα SuperIntelligent. Παραδόξως, αυτό λειτουργεί καλά για εμάς αυτή τη στιγμή σε σημείο που επεκτείνουμε συνεχώς την πρόσβαση και την εμβέλεια του πράκτορα και δεν βλέπουμε ακόμη υποβαθμισμένη γνώση ή ευφυΐα ως αποτέλεσμα.
Σημείωση: δεν εκθέτουμε τον παράγοντα σε ευαίσθητες πληροφορίες ή λειτουργικότητα. Δεν έχει άμεση πρόσβαση στα τραπεζικά μας συστήματα, στα συστήματα χρέωσης ή χρέωσης. Είναι επίσης διαχωρισμένο από τον κόσμο και δεν έχει πρόσβαση σε email ή εξωτερικά κανάλια. Καθώς αποκτούμε εμπειρία και εμπιστοσύνη, δεν νομίζω ότι είμαστε πολύ μακριά από την άρση και αυτών των περιορισμών.

Figma
Adobe XD
Blog

