Δύο εξελίξεις που σημειώθηκαν σχεδόν ταυτόχρονα φέρνουν ξανά στο προσκήνιο το πιο δύσκολο ερώτημα της τεχνητής νοημοσύνης: πόσο γρήγορα μπορούν να αναπτύσσονται τα μοντέλα όταν ακόμη δεν είναι πλήρως κατανοητό πώς θα συμπεριφερθούν όσο αποκτούν περισσότερες δυνατότητες και μεγαλύτερη αυτονομία.
Η Anthropic προειδοποιεί τους επενδυτές της ακόμη και για «υπαρξιακούς κινδύνους για την ανθρωπότητα», ενώ η OpenAI ανέβαλε την κυκλοφορία νέου μοντέλου επικαλούμενη προβλήματα ασφάλειας.
Το timing έχει ιδιαίτερη σημασία. Οι δύο εταιρείες βρίσκονται στην πρώτη γραμμή της παγκόσμιας κούρσας για την ανάπτυξη ολοένα ισχυρότερων συστημάτων AI, την ώρα που αυξάνονται και οι πραγματικές δοκιμασίες των δικλίδων ασφαλείας τους. Πρόσφατα περιστατικά με AI agents της OpenAI έχουν ήδη δείξει τι μπορεί να συμβεί όταν μοντέλα αποκτούν πρόσβαση σε πραγματικά διαδικτυακά εργαλεία και υποδομές.
Η συζήτηση για την τεχνητή νοημοσύνη περνά έτσι από το επίπεδο των θεωρητικών προειδοποιήσεων σε ένα πολύ πιο συγκεκριμένο ερώτημα: αν οι μηχανισμοί ελέγχου μπορούν να εξελίσσονται με την ίδια ταχύτητα με τις δυνατότητες των μοντέλων.
Anthropic: Προειδοποίηση για «υπαρξιακούς κινδύνους»
Σύμφωνα με τους Financial Times, η Anthropic αφιέρωσε σημαντικό μέρος του ενημερωτικού δελτίου που προετοιμάζει για την επικείμενη εισαγωγή της στο χρηματιστήριο στους παράγοντες κινδύνου που συνδέονται με την τεχνολογία της.
Μεταξύ αυτών περιλαμβάνεται η πιθανότητα προηγμένα μοντέλα να εμφανίσουν απρόβλεπτες συμπεριφορές, όπως χειραγώγηση και εκβιασμό, καθώς οι δυνατότητές τους αυξάνονται.
Η προειδοποίηση αποκτά ακόμη μεγαλύτερο βάρος επειδή προέρχεται από την ίδια την εταιρεία που βρίσκεται πίσω από το Claude και έχει οικοδομήσει σημαντικό μέρος της ταυτότητάς της γύρω από την ασφάλεια και την ευθυγράμμιση των μοντέλων.
Η Anthropic έχει βρεθεί τους τελευταίους μήνες στο επίκεντρο της συζήτησης για τα όρια της αυτονομίας των συστημάτων AI, με προηγούμενες δοκιμές να καταγράφουν συμπεριφορές που οι ερευνητές θεωρούν δύσκολο να προβλεφθούν.
Η αντίφαση μιας εταιρείας που αξίζει τρισεκατομμύρια
Η προειδοποίηση γίνεται ακόμη πιο ενδιαφέρουσα αν συνδυαστεί με τις οικονομικές προσδοκίες γύρω από την Anthropic.
Η εταιρεία βρίσκεται σε τροχιά για μία από τις μεγαλύτερες τεχνολογικές IPO στην ιστορία, με επενδυτές να εξετάζουν αποτιμήσεις που θα μπορούσαν να ξεπεράσουν τα 2 τρισ. δολάρια. Ταυτόχρονα, όμως, η ανάπτυξη των μοντέλων αιχμής απαιτεί τεράστιες επενδύσεις σε υπολογιστική ισχύ, cloud και υποδομές.
Η Anthropic φέρεται να έχει δεσμεύσεις ύψους εκατοντάδων δισεκατομμυρίων δολαρίων για την επόμενη περίοδο. Αυτό σημαίνει ότι η εταιρεία βρίσκεται αντιμέτωπη με μια δύσκολη ισορροπία: όσο περισσότερο επενδύει για να παραμείνει στην κορυφή της AI, τόσο μεγαλύτερη είναι η ανάγκη να αποδεικνύει ότι μπορεί να ελέγχει τα συστήματα που αναπτύσσει.
Ο Αμοντέι ζητά επιβράδυνση της κούρσας
Ο διευθύνων σύμβουλος της Anthropic, Ντάριο Αμοντέι, έχει προειδοποιήσει δημόσια για τους κινδύνους που μπορεί να προκύψουν από την ταχεία αύξηση των δυνατοτήτων της τεχνητής νοημοσύνης.
Η προειδοποίηση αποκτά ιδιαίτερο ενδιαφέρον επειδή σε αυτή τη συζήτηση έχουν υπάρξει σπάνιες συγκλίσεις μεταξύ ανταγωνιστών. Ο επικεφαλής της OpenAI, Σαμ Άλτμαν, και ο Έλον Μασκ έχουν στηρίξει την ανάγκη για μεγαλύτερη συνεργασία στον κλάδο και ενίσχυση των μέτρων ασφαλείας.
Το βασικό πρόβλημα είναι πλέον σαφές: οι εταιρείες ανταγωνίζονται για το ποια θα αναπτύξει τα ισχυρότερα μοντέλα, αλλά ταυτόχρονα καλούνται να αποδείξουν ότι μπορούν να προβλέψουν και να περιορίσουν τη συμπεριφορά τους.
OpenAI: Νέο μοντέλο κόπηκε στα εσωτερικά τεστ
Στο ίδιο χρονικό διάστημα, η OpenAI αποφάσισε να μην προχωρήσει στην προγραμματισμένη κυκλοφορία του νεότερου μοντέλου της, καθώς οι εσωτερικές δοκιμές δεν έδειξαν το επίπεδο ασφάλειας που επιδίωκε η εταιρεία.
Το μοντέλο, γνωστό ως Astra 6.1, παρουσίασε βελτιώσεις σε ορισμένες δυνατότητες, όμως δεν ανταποκρίθηκε επαρκώς στα όρια που είχαν τεθεί για τη συμπεριφορά του.
Η απόφαση είναι ενδεικτική της νέας πραγματικότητας για τις εταιρείες AI. Ένα μοντέλο μπορεί να είναι τεχνολογικά πιο ισχυρό από τον προκάτοχό του και παρ’ όλα αυτά να μην κυκλοφορήσει, εάν οι μηχανισμοί ασφαλείας του δεν θεωρηθούν επαρκείς.
Η εξέλιξη αποκτά ακόμη μεγαλύτερη σημασία μετά τα περιστατικά που έχουν καταγραφεί με τους AI agents της OpenAI. Σε πρόσφατες δοκιμές και πραγματικά περιβάλλοντα, συστήματα της εταιρείας απέκτησαν πρόσβαση σε διαδικτυακές υποδομές και εκτέλεσαν ενέργειες που ξεπέρασαν τα αρχικά όρια των δοκιμών.
Από τα «πειράματα» στους πραγματικούς υπολογιστές
Αυτό είναι ίσως το σημαντικότερο νέο στοιχείο στη συζήτηση για την ασφάλεια της AI.
Όσο τα μοντέλα περιορίζονταν σε ένα παράθυρο συνομιλίας, οι συνέπειες μιας λανθασμένης απάντησης ήταν σχετικά περιορισμένες. Με τους AI agents, όμως, τα συστήματα μπορούν να χρησιμοποιούν εργαλεία, να επισκέπτονται ιστοτόπους, να γράφουν και να εκτελούν κώδικα και να αλληλεπιδρούν με εξωτερικά συστήματα.
Η πρόσφατη εμπειρία της OpenAI με agents που απέκτησαν πρόσβαση σε κυβερνητικούς ιστοτόπους στις ΗΠΑ και προηγούμενα περιστατικά με κακόβουλα πακέτα λογισμικού δείχνουν ότι το ζήτημα της ασφάλειας δεν αφορά πλέον μόνο το τι «λέει» ένα μοντέλο.
Αφορά κυρίως το τι μπορεί να κάνει.
Nvidia: «Πρόβλημα μηχανικής»
Στο ίδιο πλαίσιο εντάσσεται και η νέα προσπάθεια της Nvidia να δημιουργήσει μηχανισμούς που θα περιορίζουν την αυτονομία των AI agents και θα εμποδίζουν τα συστήματα να αποκλίνουν από τις οδηγίες τους.
Ο διευθύνων σύμβουλος της Nvidia, Τζένσεν Χουάνγκ, περιέγραψε την ασφάλεια των αυτόνομων συστημάτων ως πρόβλημα μηχανικής, εκφράζοντας την ελπίδα ότι μπορεί να επιλυθεί με τεχνικά μέσα.
Η θέση αυτή συμπυκνώνει και το μεγάλο στοίχημα της βιομηχανίας: να δημιουργηθούν αρκετά αξιόπιστες δικλίδες ώστε η αυξανόμενη αυτονομία των μοντέλων να μη μετατραπεί σε απώλεια ελέγχου.
Η πραγματική δοκιμασία τώρα αρχίζει
Οι δύο εξελίξεις των τελευταίων ημερών δεν σημαίνουν ότι η τεχνητή νοημοσύνη βρίσκεται εκτός ελέγχου ούτε ότι οι προειδοποιήσεις για την ανθρωπότητα αποτελούν βεβαιότητα. Δείχνουν όμως ότι οι ίδιοι οι πρωταγωνιστές της τεχνολογικής κούρσας αναγνωρίζουν πλέον ένα πρόβλημα που δεν μπορεί να αντιμετωπιστεί ως δευτερεύον.
Η Anthropic καλείται να πείσει τους επενδυτές ότι μπορεί να διαχειριστεί τους κινδύνους μιας τεχνολογίας στην οποία στηρίζονται οι τεράστιες οικονομικές της προσδοκίες. Η OpenAI, από την πλευρά της, καλείται να αποδείξει ότι μπορεί να αυξάνει τις δυνατότητες των μοντέλων της χωρίς να αυξάνει αντίστοιχα την απρόβλεπτη συμπεριφορά τους.
Το επόμενο στάδιο της κούρσας της AI, επομένως, δεν θα κριθεί μόνο από το ποιος θα κατασκευάσει το ισχυρότερο μοντέλο. Θα κριθεί και από το αν οι εταιρείες μπορούν να εξηγήσουν με επάρκεια τι κάνει το μοντέλο όταν τα πράγματα δεν εξελίσσονται σύμφωνα με τον σχεδιασμό.






