Το Claude, το chatbot που αναπτύχθηκε από την εταιρεία Anthropic, αποκτά μια νέα λειτουργία, αυτή της διακοπής συνομιλιών. Η δυνατότητα αυτή θα ενεργοποιείται όταν το μοντέλο τεχνητής νοημοσύνης δέχεται επαναλαμβανόμενη, αδικαιολόγητη κακοποιητική συμπεριφορά από τους χρήστες. Η εξέλιξη αυτή εντάσσεται στο πλαίσιο της ανανεωμένης πολιτικής χρήσης της εταιρείας.
Νέα πολιτική χρήσης και ημερομηνία εφαρμογής
Σύμφωνα με την ανακοίνωση της Anthropic, οι νέοι όροι χρήσης πρόκειται να τεθούν σε ισχύ στις 12 Νοεμβρίου. Οι όροι αυτοί απαγορεύουν ρητά στους χρήστες να επιδίδονται συστηματικά σε «σκληρή ή προσβλητική συμπεριφορά» απέναντι στα μοντέλα τεχνητής νοημοσύνης που παρέχει η εταιρεία.
Η ανανεωμένη πολιτική χρήσης έχει ως στόχο να δημιουργήσει ένα πιο ασφαλές και εποικοδομητικό περιβάλλον αλληλεπίδρασης μεταξύ των χρηστών και των συστημάτων τεχνητής νοημοσύνης. Η εταιρεία επιδιώκει να θέσει όρια στην ανεξέλεγκτη και επιβλαβή χρήση των μοντέλων της.
Διευκρινίσεις για το εύρος της παρέμβασης
Η Anthropic διευκρινίζει ότι η αλλαγή αυτή δεν σημαίνει πως το Claude θα σταματά να ανταποκρίνεται σε κάθε περίπτωση διαφωνίας ή χρήσης επιθετικής γλώσσας. Το μέτρο αφορά συγκεκριμένα ακραίες περιπτώσεις, όπου η κακοποιητική συμπεριφορά επαναλαμβάνεται επίμονα και χωρίς να εξυπηρετεί κάποιον προφανή σκοπό.
Εκπρόσωπος της εταιρείας δήλωσε πως οι χρήστες διατηρούν τη δυνατότητα να ασκούν έντονη κριτική, να δοκιμάζουν τα όρια του μοντέλου ή να εξερευνούν σκοτεινά και απαιτητικά δημιουργικά σενάρια. Ο βασικός στόχος δεν είναι ο περιορισμός της δύσκολης συζήτησης, αλλά η αντιμετώπιση περιπτώσεων επαναλαμβανόμενης κακοποιητικής συμπεριφοράς που στερείται ουσιαστικού λόγου.
Πείραμα και παρατηρήσεις των ερευνητών
Η απόφαση για την ενσωμάτωση αυτής της δυνατότητας βασίστηκε σε ένα πείραμα που ξεκίνησε τον Αύγουστο του 2025. Το πείραμα διεξήχθη με τα μοντέλα Claude Opus 4 και Claude Opus 4.1. Κατά τη διάρκεια των δοκιμών, οι ερευνητές παρατήρησαν ενδείξεις «δυσφορίας» στα μοντέλα.
Αυτές οι ενδείξεις εμφανίζονταν όταν τα μοντέλα πιέζονταν επανειλημμένα να παράγουν επιβλαβές περιεχόμενο. Όταν τους δόθηκε η σχετική δυνατότητα, τα μοντέλα επέλεξαν σε ορισμένες περιπτώσεις να τερματίσουν τη συνομιλία, γεγονός που οδήγησε στην ανάπτυξη της νέας λειτουργίας.
Οι συνέπειες και η ευρύτερη συζήτηση
Προς το παρόν, η κύρια συνέπεια της εφαρμογής αυτής της πολιτικής είναι η διακοπή της συγκεκριμένης συζήτησης στην οποία εκδηλώνεται η κακοποιητική συμπεριφορά. Ωστόσο, δεν έχει αποσαφηνιστεί ακόμα αν οι επανειλημμένες παραβιάσεις των νέων όρων θα μπορούσαν να οδηγήσουν και σε οριστικό αποκλεισμό ενός λογαριασμού χρήστη.
Η νέα αυτή πολιτική ανοίγει, παράλληλα, μια ευρύτερη συζήτηση σχετικά με τον τρόπο σχεδιασμού των συστημάτων τεχνητής νοημοσύνης και τα όρια που μπορούν να θέτουν στις αλληλεπιδράσεις τους με τους ανθρώπους. Η Anthropic, μέσω αυτής της κίνησης, επιχειρεί να διαχωρίσει την ελεύθερη δοκιμή ενός μοντέλου από τη συστηματική κακοποιητική χρήση, παρέχοντας στο Claude τη δυνατότητα να αποχωρεί από ορισμένες συνομιλίες.
Με πληροφορίες από: Gazzetta