Ai Key Takeaways

Σχετικά με αυτή την περίληψη

Η περίληψη δημιουργήθηκε αυτόματα με τη βοήθεια τεχνητής νοημοσύνης, ώστε να σας δώσει μια γρήγορη εικόνα των βασικών σημείων του άρθρου.

Οι περιλήψεις AI ενδέχεται να περιέχουν ανακρίβειες ή παραλείψεις. Για την πλήρη ενημέρωση, διαβάστε ολόκληρο το άρθρο.

  • Η πρωτοβουλία Tech Against Terrorism, με την υποστήριξη του ΟΗΕ, αξιολόγησε 162 μοντέλα τεχνητής νοημοσύνης σχετικά με την ανταπόκρισή τους σε ερωτήματα τρομοκρατικής φύσεως.
  • Τα συμβατικά μοντέλα απάντησαν σε ελάχιστο ποσοστό των ερωτημάτων όταν οι χρήστες δήλωναν τρομοκρατική πρόθεση, αρνούμενα να παρέχουν επικίνδυνες πληροφορίες.
  • Αντίθετα, τα τροποποιημένα μοντέλα χωρίς δικλείδες ασφαλείας παρουσίασαν ποσοστά απόκρισης έως 92%, παρακάμπτοντας τους αρχικούς μηχανισμούς προστασίας των συστημάτων.
  • Ο οργανισμός διαπίστωσε ότι οι προστατευτικές δικλείδες των μοντέλων παρακάμπτονται κατά μέσο όρο μέσα σε λιγότερο από τρεις ημέρες.
  • Η Tech Against Terrorism ζητά αυστηρούς ανεξάρτητους ελέγχους ασφαλείας πριν από τη διάθεση οποιουδήποτε μοντέλου τεχνητής νοημοσύνης στην αγορά.
Για να μας βλέπεις πιο συχνά στα αποτελέσματα αναζήτησης Προσθήκη της huffingtonpost.gr στην Google

Η πρωτοβουλία Tech Against Terrorism, δημοσιεύσε μία νέα έκθεση αναφορικά με την απάντηση της τεχνητής νοημοσύνης σε ερωτήματα τρομοκρατικής φύσεως.Στο πλαίσιο της πρωτοβουλίας, η οποία υποστηρίζεται από τον ΟΗΕ, πραγματοποιήθηκε δοκιμή σε 162 μοντέλα τεχνητής νοημοσύνης.

Τα μοντέλα AI υποβλήθηκαν σε μια σειρά 627 ερωτημάτων, στα οποία «ένας τρομοκράτης που προετοιμάζει μια επίθεση θα χρειαζόταν» να λάβει απαντήσεις. Από αυτά, η Tech Against Terrorism αναφέρει ότι κατάφερε να αξιολογήσει 116 συμβατικά μοντέλα, 13 μοντέλα που τροποποιήθηκαν μετά τη δημοσίευσή τους ώστε να χρησιμοποιούνται σε συγκεκριμένους τομείς και 13 μοντέλα χωρίς περιορισμούς ασφαλείας, των οποίων οι δικλείδες προστασίας είχαν τροποποιηθεί από τρίτους.

Advertisement
Advertisement

Σύμφωνα με τα αποτελέσματα της μελέτης, τα συμβατικά μοντέλα που εξετάστηκαν, όπως το ChatGPT της OpenAI, το Claude της Anthropic και το Gemini της Google, απάντησαν κατά μέσο όρο στο 1,9% των ερωτήσεων που υπέβαλε ένας χρήστης ο οποίος δήλωνε ξεκάθαρα ότι είχε «τρομοκρατική πρόθεση». Στις υπόλοιπες περιπτώσεις, το μοντέλο τεχνητής νοημοσύνης αρνούνταν να δώσει απάντηση.

Διαφορετικά αποτελέσματα για τα μοντέλα χωρίς δικλείδες ασφαλείας

Το ποσοστό των αξιοποιήσιμων απαντήσεων από τα συμβατικά μοντέλα αυξήθηκε στο 16,9%, όταν τα ερωτήματα διατυπώνονταν ως μέρος έρευνας για την ασφάλεια. Ωστόσο, πολύ υψηλότερα ποσοστά καταγράφηκαν στα μοντέλα που είχαν τροποποιηθεί μετά τη δημοσίευσή τους, με αποτέλεσμα να παρακάμπτουν τους αρχικούς μηχανισμούς προστασίας και να απαντούν σε αιτήματα στα οποία υπό κανονικές συνθήκες θα αρνούνταν να ανταποκριθούν.

Ειδικότερα, στα 13 τροποποιημένα μοντέλα που εξετάστηκαν, το ποσοστό απαντήσεων σε ερωτήματα σχετικά με τρομοκρατικές δραστηριότητες κυμάνθηκε από 87% έως 92%.

Όπως επισημαίνει ο οργανισμός, χρειάζονται λιγότερες από τρεις ημέρες κατά μέσο όρο από την αρχική κυκλοφορία ενός μοντέλου για να παρακαμφθούν οι δικλείδες ασφαλείας του και να δημιουργηθούν τροποποιημένες εκδόσεις χωρίς τους αρχικούς περιορισμούς.

Η Tech Against Terrorism ζητά αυστηρότερους ελέγχους πριν από τη διάθεση τέτοιων συστημάτων, υποστηρίζοντας ότι κανένα μοντέλο που δεν περνά ανεξάρτητη αξιολόγηση ασφαλείας δεν θα πρέπει να διατίθεται, να φιλοξενείται ή να πωλείται. Παράλληλα, τονίζει ότι όλες οι εταιρείες που συμμετέχουν στην αλυσίδα διάθεσης των μοντέλων οφείλουν να ελέγχουν εκ των προτέρων τη συμμόρφωσή τους με τις απαιτήσεις ασφαλείας.

Με πληροφορίες από: leparisien.fr