Η πρωτοβουλία Tech Against Terrorism, δημοσιεύσε μία νέα έκθεση αναφορικά με την απάντηση της τεχνητής νοημοσύνης σε ερωτήματα τρομοκρατικής φύσεως.Στο πλαίσιο της πρωτοβουλίας, η οποία υποστηρίζεται από τον ΟΗΕ, πραγματοποιήθηκε δοκιμή σε 162 μοντέλα τεχνητής νοημοσύνης.
Τα μοντέλα AI υποβλήθηκαν σε μια σειρά 627 ερωτημάτων, στα οποία «ένας τρομοκράτης που προετοιμάζει μια επίθεση θα χρειαζόταν» να λάβει απαντήσεις. Από αυτά, η Tech Against Terrorism αναφέρει ότι κατάφερε να αξιολογήσει 116 συμβατικά μοντέλα, 13 μοντέλα που τροποποιήθηκαν μετά τη δημοσίευσή τους ώστε να χρησιμοποιούνται σε συγκεκριμένους τομείς και 13 μοντέλα χωρίς περιορισμούς ασφαλείας, των οποίων οι δικλείδες προστασίας είχαν τροποποιηθεί από τρίτους.
Σύμφωνα με τα αποτελέσματα της μελέτης, τα συμβατικά μοντέλα που εξετάστηκαν, όπως το ChatGPT της OpenAI, το Claude της Anthropic και το Gemini της Google, απάντησαν κατά μέσο όρο στο 1,9% των ερωτήσεων που υπέβαλε ένας χρήστης ο οποίος δήλωνε ξεκάθαρα ότι είχε «τρομοκρατική πρόθεση». Στις υπόλοιπες περιπτώσεις, το μοντέλο τεχνητής νοημοσύνης αρνούνταν να δώσει απάντηση.
Διαφορετικά αποτελέσματα για τα μοντέλα χωρίς δικλείδες ασφαλείας
Το ποσοστό των αξιοποιήσιμων απαντήσεων από τα συμβατικά μοντέλα αυξήθηκε στο 16,9%, όταν τα ερωτήματα διατυπώνονταν ως μέρος έρευνας για την ασφάλεια. Ωστόσο, πολύ υψηλότερα ποσοστά καταγράφηκαν στα μοντέλα που είχαν τροποποιηθεί μετά τη δημοσίευσή τους, με αποτέλεσμα να παρακάμπτουν τους αρχικούς μηχανισμούς προστασίας και να απαντούν σε αιτήματα στα οποία υπό κανονικές συνθήκες θα αρνούνταν να ανταποκριθούν.
Ειδικότερα, στα 13 τροποποιημένα μοντέλα που εξετάστηκαν, το ποσοστό απαντήσεων σε ερωτήματα σχετικά με τρομοκρατικές δραστηριότητες κυμάνθηκε από 87% έως 92%.
Όπως επισημαίνει ο οργανισμός, χρειάζονται λιγότερες από τρεις ημέρες κατά μέσο όρο από την αρχική κυκλοφορία ενός μοντέλου για να παρακαμφθούν οι δικλείδες ασφαλείας του και να δημιουργηθούν τροποποιημένες εκδόσεις χωρίς τους αρχικούς περιορισμούς.
Η Tech Against Terrorism ζητά αυστηρότερους ελέγχους πριν από τη διάθεση τέτοιων συστημάτων, υποστηρίζοντας ότι κανένα μοντέλο που δεν περνά ανεξάρτητη αξιολόγηση ασφαλείας δεν θα πρέπει να διατίθεται, να φιλοξενείται ή να πωλείται. Παράλληλα, τονίζει ότι όλες οι εταιρείες που συμμετέχουν στην αλυσίδα διάθεσης των μοντέλων οφείλουν να ελέγχουν εκ των προτέρων τη συμμόρφωσή τους με τις απαιτήσεις ασφαλείας.
Με πληροφορίες από: leparisien.fr