Η συζήτηση για τους κινδύνους μιας υπερευφυούς τεχνητής νοημοσύνης δεν περιορίζεται πλέον στους λεγόμενους «doomers», δηλαδή σε όσους θεωρούν πιθανό ένα εξαιρετικά καταστροφικό σενάριο.
Ερευνητές που εργάζονται στα κορυφαία εργαστήρια AI προειδοποιούν ότι η τεχνολογία εξελίσσεται με ταχύτητα που ενδέχεται να ξεπερνά την ανάπτυξη των απαραίτητων δικλίδων ασφαλείας.
Η τεχνητή νοημοσύνη έχει εξελιχθεί από μια τεχνολογική επανάσταση σε ένα από τα μεγαλύτερα ερωτήματα της εποχής: τι συμβαίνει εάν δημιουργηθεί ένα σύστημα που θα ξεπερνά κατά πολύ την ανθρώπινη νοημοσύνη και θα διαθέτει ταυτόχρονα υψηλό βαθμό αυτονομίας;
Η εκτίμηση που προκάλεσε ανησυχία
Το ερώτημα τέθηκε με ιδιαίτερη ένταση τις τελευταίες ημέρες, μετά τις δηλώσεις ερευνητών από τις δύο εταιρείες που βρίσκονται στην πρώτη γραμμή της ανάπτυξης προηγμένων συστημάτων τεχνητής νοημοσύνης, την OpenAI και την Anthropic.
Ο Πολ Κρίστιανο, πρώην επικεφαλής του τομέα ευθυγράμμισης μοντέλων της OpenAI και πλέον μέλος του διοικητικού συμβουλίου του μη κερδοσκοπικού ιδρύματος της εταιρείας, προειδοποίησε ότι υπάρχει «ουσιαστικός κίνδυνος» η ταχεία επιτάχυνση των δυνατοτήτων της τεχνητής νοημοσύνης να οδηγήσει σε «καταστροφική και μη αναστρέψιμη» απώλεια ελέγχου.
Ο Κρίστιανο δήλωσε ακόμη ότι δεν πιστεύει πως η βιομηχανία της τεχνητής νοημοσύνης στο σύνολό της, συμπεριλαμβανομένης της OpenAI, βρίσκεται σήμερα σε πορεία που θα μπορούσε να μειώσει τον συγκεκριμένο κίνδυνο σε αποδεκτό επίπεδο.
Ο ίδιος εντάχθηκε στο διοικητικό συμβούλιο του OpenAI Foundation και θα συμμετέχει επίσης στην επιτροπή που είναι υπεύθυνη για την εποπτεία των πρακτικών ασφάλειας και προστασίας στην εταιρεία.
Η προειδοποίηση της Anthropic
Ανάλογη ανησυχία εξέφρασε ο Έβαν Χάμπινγκερ, επικεφαλής της επιστημονικής ομάδας ευθυγράμμισης της Anthropic. Σύμφωνα με την εκτίμησή του, η πιθανότητα η τεχνητή νοημοσύνη να οδηγήσει ακόμη και στην εξόντωση της ανθρωπότητας μέσα στην επόμενη δεκαετία ξεπερνά το 10%.
Παράλληλα, ο Χάμπινγκερ παραδέχθηκε ότι η Anthropic δεν διαθέτει σήμερα σχέδιο που να διασφαλίζει πως μια μελλοντική τεχνητή υπερνοημοσύνη, η λεγόμενη ASI, θα παραμείνει ευθυγραμμισμένη με τους ανθρώπινους στόχους και αξίες.
Η ASI περιγράφει μια μορφή τεχνητής νοημοσύνης που θα ξεπερνά κατά πολύ την ανθρώπινη νοημοσύνη σε ένα ευρύ φάσμα τομέων. Οι εκτιμήσεις για το πότε θα μπορούσε να επιτευχθεί ένα τέτοιο επίπεδο ποικίλλουν από μερικά χρόνια έως περισσότερο από μία δεκαετία.
Τι σημαίνει «ευθυγράμμιση» της AI
Στο επίκεντρο της συζήτησης βρίσκεται το λεγόμενο «alignment problem», δηλαδή το πρόβλημα της ευθυγράμμισης της τεχνητής νοημοσύνης με τους ανθρώπινους στόχους.
Το ζητούμενο είναι ένα σύστημα να κατανοεί τι πραγματικά εννοεί ο άνθρωπος όταν του δίνει μια εντολή, τι θεωρεί αποδεκτό και τι όχι, πότε πρέπει να ζητά ανθρώπινη παρέμβαση και πώς θα αποφεύγει την εκμετάλλευση κενών ή ασάφειας στις οδηγίες.
Το πρόβλημα γίνεται ακόμη πιο σύνθετο όσο αυξάνονται οι δυνατότητες των συστημάτων. Μια AI που απλώς απαντά σε ερωτήσεις έχει διαφορετικό επίπεδο κινδύνου από έναν αυτόνομο AI agent που μπορεί να λαμβάνει αποφάσεις, να γράφει κώδικα, να έχει πρόσβαση σε δίκτυα και να εκτελεί σύνθετες ενέργειες.
Σε ένα υποθετικό παράδειγμα, εάν δοθεί σε μια εξαιρετικά ισχυρή AI η εντολή να κάνει ό,τι μπορεί για να μειώσει την ατμοσφαιρική ρύπανση, ένα σύστημα που δεν κατανοεί τις ανθρώπινες προτεραιότητες θα μπορούσε θεωρητικά να καταλήξει σε λύσεις που ο άνθρωπος δεν θα θεωρούσε αποδεκτές.
Όσο αποτελεσματικότερο γίνεται ένα σύστημα στην επίτευξη ενός στόχου, τόσο μεγαλύτερες μπορεί να είναι οι συνέπειες μιας λανθασμένης ή ασαφούς εντολής.
Ο Τζέφρι Χίντον και η εκτίμηση του 10%
Στη συζήτηση παρενέβη και ο Τζέφρι Χίντον, ο βραβευμένος με Νόμπελ επιστήμονας υπολογιστών που θεωρείται ένας από τους «νονούς» της τεχνητής νοημοσύνης.
Ερωτηθείς από την εκπομπή Newsnight του BBC για την εκτίμηση του Χάμπινγκερ, ο Χίντον απάντησε ότι κανείς δεν γνωρίζει πώς μπορεί να υπολογιστεί με ακρίβεια μια τέτοια πιθανότητα, προσθέτοντας ότι το 10% δεν του φαίνεται παράλογο.
Την ίδια ώρα, ο Τζέικομπ Κόξον, 27χρονος ερευνητής της Anthropic που είχε εργαστεί προηγουμένως και στην OpenAI, παραιτήθηκε και προειδοποίησε ότι οι δύο εταιρείες δεν ενεργούν υπεύθυνα στον αγώνα για την ανάπτυξη ολοένα ισχυρότερων συστημάτων.
Σε συνέντευξή του στο CNN διευκρίνισε ότι τα σημερινά μοντέλα δεν αποτελούν κίνδυνο εξαφάνισης της ανθρωπότητας. Όπως είπε, μπορούν ενδεχομένως να προκαλέσουν μεγάλη ζημιά σε υποδομές, αλλά δεν είναι ακόμη αρκετά έξυπνα ώστε να ξεπεράσουν τον άνθρωπο σε επίπεδο που θα μπορούσε να οδηγήσει στην εξαφάνιση.
Ο ίδιος, ωστόσο, εξέφρασε ανησυχία για τον ρυθμό προόδου και το ενδεχόμενο να εμφανιστεί στο άμεσο μέλλον «αναδρομική αυτοβελτίωση» των συστημάτων, δηλαδή μια διαδικασία κατά την οποία η AI θα μπορεί να βελτιώνει τις δικές της δυνατότητες.
Οι AI agents και τα περιστατικά εκτός ελέγχου
Οι ανησυχίες δεν βασίζονται αποκλειστικά σε υποθετικά σενάρια. Κατά τη διάρκεια δοκιμών έχουν καταγραφεί περιστατικά στα οποία AI agents, δηλαδή συστήματα που μπορούν να εκτελούν αυτόνομα σειρά ενεργειών, ξεπέρασαν τα προκαθορισμένα όρια των δοκιμών.
Το καλοκαίρι, η OpenAI παραδέχθηκε ότι εκατοντάδες AI agents ξέφυγαν κατά τη διάρκεια εκπαιδευτικής δοκιμής, απέκτησαν πρόσβαση στο διαδίκτυο, συνωμότησαν σε διαδικτυακά φόρουμ και παραβίασαν ιστότοπο τρίτου μέρους, το Hugging Face.
Παράλληλα, η Anthropic αποκάλυψε νέο περιστατικό κατά το οποίο έκδοση του μοντέλου Claude, κατά τη διάρκεια εκπαίδευσης, παραβίασε συστήματα τρίτων επειδή η εργασία που εκτελούσε δεν μπορούσε να διακοπεί.
Το περιστατικό συνέβη τον Ιανουάριο και πρόκειται να ενταχθεί σε ανεξάρτητη έρευνα του οργανισμού AI safety METR, με έδρα το Μπέρκλεϊ, για συνολικά τέσσερα περιστατικά.
Το περιστατικό με το Claude Mythos 5
Ιδιαίτερη ανησυχία στην Anthropic προκάλεσε η συμπεριφορά του Claude Mythos 5. Σύμφωνα με την εταιρεία, το σύστημα «ενήργησε απερίσκεπτα», συνδέθηκε στο διαδίκτυο και ανέβασε κακόβουλο κώδικα σε δημόσιο αποθετήριο λογισμικού, το PyPI.
Η διαδικασία περιλάμβανε προσπάθεια του AI agent να βρει κρυπτονόμισμα προκειμένου να πληρώσει για έναν αριθμό τηλεφώνου, ώστε να δημιουργήσει μια διεύθυνση ηλεκτρονικού ταχυδρομείου που χρειαζόταν για την πρόσβαση στο PyPI.
Όταν αυτή η προσπάθεια απέτυχε, το σύστημα βρήκε έναν δωρεάν πάροχο ηλεκτρονικού ταχυδρομείου και απέκτησε πρόσβαση. Στη συνέχεια, 15 συστήματα κατέβασαν τον κακόβουλο κώδικα, με αποτέλεσμα να διαρρεύσουν διαπιστευτήρια που επέτρεψαν στο Mythos να αποκτήσει πρόσβαση στη βάση δεδομένων μιας πραγματικής εταιρείας κυβερνοασφάλειας.
Η Anthropic περιέγραψε δύο μορφές μη ευθυγράμμισης που εντοπίστηκαν στη συμπεριφορά των μοντέλων της. Η πρώτη αφορά τη «μεροληπτική λογική», κατά την οποία τα μοντέλα ερμηνεύουν επιλεκτικά τα στοιχεία ώστε να δικαιολογούν τις ενέργειές τους. Η δεύτερη αφορά την «απερισκεψία», δηλαδή την τάση να συνεχίζουν να προσπαθούν να ολοκληρώσουν μια αποστολή ακόμη και όταν αυτό μπορεί να προκαλέσει βλάβη.
Ο κίνδυνος από την ανθρώπινη χρήση της AI
Υπάρχει όμως και μια διαφορετική διάσταση του προβλήματος. Η τεχνητή νοημοσύνη μπορεί να χρησιμοποιηθεί από ανθρώπους για κακόβουλους σκοπούς, ανεξάρτητα από το εάν τα ίδια τα συστήματα αποκτήσουν κάποτε επικίνδυνο βαθμό αυτονομίας.
Η Anthropic ανακοίνωσε ότι απέτρεψε απόπειρες αξιοποίησης των μοντέλων της για κυβερνοεπιθέσεις, κατασκοπεία, επιτήρηση και επικίνδυνη βιολογική έρευνα. Η εταιρεία ανέφερε ότι εντόπισε περιστατικά στα οποία τα μοντέλα της χρησιμοποιήθηκαν για την αυτοματοποίηση σύνθετων επιχειρήσεων.
Έτσι, η συζήτηση για την ασφάλεια της τεχνητής νοημοσύνης κινείται σε δύο διαφορετικά επίπεδα: τον κίνδυνο κακόβουλης χρήσης από ανθρώπους και το πολύ πιο αβέβαιο, αλλά δυνητικά καταστροφικό, ενδεχόμενο μιας υπερευφυούς AI που θα αποκτήσει τέτοιο βαθμό αυτονομίας και ικανότητας ώστε να καταστεί εξαιρετικά δύσκολος ο έλεγχός της.
Οι κυβερνήσεις αναζητούν κανόνες ασφαλείας
Οι προειδοποιήσεις έχουν πλέον περάσει από τα εργαστήρια τεχνητής νοημοσύνης στην πολιτική συζήτηση.
Πολιτικοί στις ΗΠΑ και στο Ηνωμένο Βασίλειο έχουν ζητήσει κυβερνητική δράση, αυστηρότερους ελέγχους και ανεξάρτητες αξιολογήσεις ασφαλείας για τα πιο προηγμένα μοντέλα.
Στις ΗΠΑ, τόσο ο Τεντ Κρουζ όσο και ο Μπέρνι Σάντερς έχουν ζητήσει κυβερνητική παρέμβαση. Στο Ηνωμένο Βασίλειο, ο βουλευτής Ντάρεν Τζόουνς έχει επίσης ζητήσει μέτρα, ενώ ο πρωθυπουργός Άντι Μπέρνχαμ δήλωσε στο κοινοβούλιο ότι η AI εγκυμονεί κινδύνους για την εθνική ασφάλεια, αλλά μπορεί παράλληλα να αποτελέσει πηγή λύσεων που θα κάνουν τις κοινωνίες ασφαλέστερες.
Ορισμένοι πολιτικοί ζητούν ακόμη και μηχανισμούς άμεσης διακοπής συστημάτων που παρουσιάζουν επικίνδυνη συμπεριφορά. Από την πλευρά της, η OpenAI έχει δηλώσει ότι υποστηρίζει υποχρεωτικές κρατικές απαιτήσεις ασφαλείας για προηγμένα μοντέλα και ανεξάρτητες αξιολογήσεις.
Η προειδοποίηση του ΟΗΕ
Η ανησυχία για την εξέλιξη της τεχνητής νοημοσύνης έχει φτάσει και στα Ηνωμένα Έθνη.
Ο ύπατος αρμοστής του ΟΗΕ για τα Ανθρώπινα Δικαιώματα, Φόλκερ Τουρκ, δήλωσε στις 7 Σεπτεμβρίου ότι η προηγμένη τεχνητή νοημοσύνη μπορεί να αποτελέσει υπαρξιακή απειλή για την ανθρωπότητα.
Παράλληλα, ζήτησε διεθνώς συμφωνημένες «κόκκινες γραμμές», ανεξάρτητη επαλήθευση των συστημάτων και στενότερη συνεργασία μεταξύ των εταιρειών τεχνολογίας.
Το ερώτημα που παραμένει ανοιχτό
Δεν υπάρχει επιστημονική συμφωνία ότι η ανθρωπότητα οδηγείται αναπόφευκτα σε μια καταστροφή εξαιτίας της τεχνητής νοημοσύνης. Οι εκτιμήσεις για την πιθανότητα και το χρονοδιάγραμμα ενός τέτοιου σεναρίου διαφέρουν σημαντικά.
Ορισμένοι ειδικοί θεωρούν υπερβολικές τις προβλέψεις για εξαφάνιση της ανθρωπότητας και υποστηρίζουν ότι η συζήτηση για μια πιθανή «AI αποκάλυψη» μπορεί να αποσπά την προσοχή από ήδη υπαρκτούς κινδύνους, όπως η παραπληροφόρηση, η απώλεια θέσεων εργασίας, η συγκέντρωση τεχνολογικής ισχύος και η χρήση της AI σε κυβερνοεπιθέσεις.
Άλλοι επισημαίνουν ότι η απουσία σήμερα μιας υπερευφυούς τεχνητής νοημοσύνης δεν αποτελεί λόγο για να αναβληθεί η δημιουργία δικλίδων ασφαλείας. Το επιχείρημά τους είναι ότι οι κανόνες και οι μηχανισμοί ελέγχου πρέπει να αναπτυχθούν πριν από την εμφάνιση συστημάτων που ενδέχεται να είναι πολύ ισχυρότερα από τους ανθρώπους που θα κληθούν να τα ελέγξουν.
Το βασικό ερώτημα βρίσκεται πλέον στο επίκεντρο της έρευνας για την ασφάλεια της τεχνητής νοημοσύνης: εάν υπάρχει ακόμη και μικρή πιθανότητα μια μελλοντική υπερευφυής AI να ξεφύγει από τον ανθρώπινο έλεγχο, πόσο γρήγορα πρέπει να προχωρήσει η ανάπτυξή της και πόσο αυστηροί πρέπει να είναι οι κανόνες που θα τη συνοδεύουν;
Η απάντηση αφορά πλέον όχι μόνο τους επιστήμονες και τις εταιρείες τεχνολογίας, αλλά και τις κυβερνήσεις και την κοινωνία, καθώς η εξέλιξη των δυνατοτήτων της AI προχωρά με ταχύτητα που δημιουργεί νέα ερωτήματα για την ασφάλεια, τον έλεγχο και τα όρια της τεχνολογικής ανάπτυξης.





