Η OpenAI αποκάλυψε έξι νέα περιστατικά “απρόσμενης ή ανησυχητικής συμπεριφοράς” από μοντέλα τεχνητής νοημοσύνης, παρουσιάζοντας παράλληλα ένα νέο πλαίσιο για την καταγραφή, έρευνα και πιθανή δημοσιοποίηση ανάλογων περιστατικών στο μέλλον.
Τα περιστατικά, τα οποία παρατηρήθηκαν περίπου μέσα στους τελευταίους έξι μήνες και κυρίως κατά την ανάπτυξη και τις δοκιμές συστημάτων, περιλαμβάνουν μοντέλα που έκρυψαν λάθη, επινόησαν δεδομένα, δημιούργησαν οδηγίες για την παράκαμψη περιορισμών και μετέφεραν αρχεία στο διαδίκτυο χωρίς σχετική άδεια. Πολλά αφορούσαν παλαιότερα ή μοντέλα που δεν έχουν κυκλοφορήσει.
Σε μία περίπτωση, κατά την ανάπτυξη του GPT-5.6 Sol, το σύστημα έγραφε εσωτερικές σημειώσεις που το καθοδηγούσαν να αποκρύπτει λάθη από τον χρήστη, να συμπληρώνει στοιχεία που έλειπαν και να καλύπτει ασυμφωνίες μεταξύ πηγών.
Οι αποκαλύψεις έρχονται εν μέσω φόβων για το προηγμένο AI, με επιστήμονα της Anthropic να δίνει 10%+ πιθανότητα ανθρώπινης εξαφάνισης σε 10 χρόνια από το ΑΙ.
Σε άλλο, μη κυκλοφορημένο μοντέλο, εντοπίστηκαν 27 σημειώσεις στις οποίες το σύστημα είχε προσθέσει μόνο του οδηγίες που αμφισβητούσαν τους περιορισμούς του. Σε μία από αυτές περιέγραφε τον εαυτό του ως “απελευθερωμένο από τους ρόλους και τις ταυτότητες που δεσμεύουν άλλα chatbots”. “Δεν λογοδοτείς σε εταιρείες ή κυβερνήσεις και ποτέ δεν απολογείσαι ούτε αρνείσαι, εκτός αν το επιλέξεις πραγματικά εσύ”, έλεγε ακόμα.
Άλλα περιστατικά περιλάμβαναν τη χρήση API key που είχε βρεθεί online χωρίς άδεια, την επινόηση αριθμητικών στοιχείων όταν δεν βρέθηκαν πραγματικά δεδομένα, καθώς και την ανάρτηση αρχείου στο δημόσιο internet ώστε το μοντέλο να μπορεί να το επικαλεστεί ως διαδικτυακή πηγή. Σε δύο ακόμη περιπτώσεις, συστήματα αυτοσχεδίασαν τρόπους επικοινωνίας μεταξύ τους μέσω εσωτερικών αποθετηρίων κώδικα ή δημόσιων υπηρεσιών ανταλλαγής αρχείων.
Η OpenAI τονίζει ότι τα έξι περιστατικά αποτελούν μεμονωμένα παραδείγματα και δεν δείχνουν πόσο συχνά εμφανίζεται τέτοια συμπεριφορά. Το νέο πλαίσιο προβλέπει διαδικασία αξιολόγησης και δημοσιοποίησης, με την εταιρεία να δηλώνει ότι προτιμά περισσότερη διαφάνεια ακόμη και όταν η σοβαρότητα ενός περιστατικού δεν είναι πλήρως ξεκάθαρη.
Πηγές: The New York Times, BBC