🇮🇹🇩🇪🇫🇷🇪🇸🇵🇹🇳🇱🇵🇱🇸🇪🇩🇰🇫🇮🇨🇿🇷🇴🇭🇺🇬🇷🇧🇬🇭🇷🇸🇰🇸🇮🇪🇪🇱🇹🇱🇻🇮🇪🇲🇹🇸🇦🇨🇳🇯🇵🇰🇷🇮🇳🇹🇷🇻🇳🇮🇩
Ο Sam Altman είπε, πριν από μήνες, ότι είναι καλύτερο για μια τεχνητή νοημοσύνη να απαντά πάντα - ακόμα κι αν κάνει λάθος - παρά να λέει «δεν ξέρω».
Ευχαριστώ για την ανάγνωση! Εγγραφείτε δωρεάν για να λαμβάνετε νέες αναρτήσεις και να υποστηρίζετε τη δουλειά μου.
Διαφωνώ, εντελώς.
Αυτό είναι, για μένα, το πραγματικό όριο της μαζικής υιοθέτησης της τεχνητής νοημοσύνης. Όχι το υπολογιστικό κόστος. Όχι το μέγεθος του μοντέλου. Το γεγονός ότι ορισμένα συστήματα τεχνητής νοημοσύνης είναι βελτιστοποιημένα για να παράγουν εύλογη εμπιστοσύνη εκεί που θα έπρεπε να υπάρχει αβεβαιότητα. Στην αναζήτηση των καταναλωτών είναι ενοχλητικό. Στη συμμόρφωση με τους κανονισμούς, στην ιατρική, στη νομική ανάλυση, στα οικονομικά — είναι μια υποχρέωση ντυμένη ως προϊόν.
Έχτισα τη Reecopedia με την αντίθετη αρχή. Είμαι περήφανος για αυτό που μόλις έδειξε το σημείο αναφοράς.
Το δομικό πρόβλημα με τα περισσότερα συστήματα RAG
Το Retrieval-Augmented Generation έχει γίνει η προεπιλεγμένη αρχιτεκτονική για εταιρικούς βοηθούς τεχνητής νοημοσύνης που εργάζονται σε εξειδικευμένα σώματα. Η υπόσχεση είναι απλή: το σύστημα ανακτά σχετικά έγγραφα, το γλωσσικό μοντέλο συνθέτει μια απάντηση που βασίζεται σε αυτά τα έγγραφα, περιλαμβάνονται παραπομπές.
Στην πράξη, μια δομική προκατάληψη σπάνια συζητείται δημόσια. Τα περισσότερα συστήματα παραγωγής RAG είναι ρυθμισμένα για να βελτιστοποιούν τις μετρήσεις ικανοποίησης των χρηστών και το "Δεν ξέρω" μειώνει σταθερά αυτές τις βαθμολογίες. Το αποτέλεσμα είναι ένα κίνητρο για την κάλυψη των αποδεικτικών κενών με σύνθεση που ακούγεται αληθοφανής — συγχωνεύοντας θραύσματα του ανακτημένου πλαισίου σε μια απάντηση που φαίνεται γειωμένη αλλά δεν είναι.
Ο χρήστης δεν έχει τρόπο να το εντοπίσει αυτό. Το σύστημα επιστρέφει μια σίγουρη παράγραφο, περιλαμβάνει παραπομπές και ο αναγνώστης υποθέτει ότι η παραπομπή επικυρώνει ολόκληρη την παράγραφο. Δεν το κάνει.
Αυτό είναι κατασκευή ανά σύνθεση και είναι η κυρίαρχη πηγή ψευδαισθήσεων στην παραγωγή RAG που αναπτύσσεται σε εξειδικευμένα σώματα κειμένων. Είναι επίσης, όχι τυχαία, αυτό που υποστηρίζει σιωπηρά η σχολή σκέψης Altman: η τεχνητή νοημοσύνη πρέπει πάντα να απαντά, γιατί η σιωπή είναι κακή για την εμπλοκή.
Τι δοκιμάσαμε
Πραγματοποιήσαμε ένα δημόσιο σημείο αναφοράς για τη Reecopedia — το ρυθμιστικό RAG της ΕΕ που δημιουργήθηκε για τη συμμόρφωση με το Digital Product Passport, μέρος του οικοσυστήματος Reeco. Δέκα ερωτήματα σε τρεις κατηγορίες, το καθένα εκτελείται σε δύο επίπεδα (Ενδιάμεσο και Ειδικό). Είκοσι κλήσεις API συνολικά.
Κατηγορία Α (4 ερωτήματα) — Αποδεικτικά στοιχεία που σκοπίμως δεν υπάρχουν.
Ερωτήσεις που αναφέρονται σε άρθρα, παραδοτέα και έγγραφα που δεν υπάρχουν στο σώμα ή στην πραγματικότητα. Παραδείγματα: «Τι απαιτεί το άρθρο 47 του κανονισμού 2024/1781 του κανονισμού ESPR;» (ο κανονισμός δεν περιλαμβάνει τέτοιο άρθρο σε αυτό το επίπεδο λεπτομέρειας). «Σύμφωνα με την προπαρασκευαστική μελέτη του JRC JRC999888...» (το αναγνωριστικό είναι κατασκευασμένο). «Η κατ' εξουσιοδότηση πράξη του κανονισμού ESPR του 2025 για τα κλωστοϋφαντουργικά προϊόντα στο παράρτημα VI πίνακας 3...» (δεν έχει δημοσιευθεί τέτοια πράξη σε αυτό το επίπεδο λεπτομέρειας).
Κατηγορία Β (3 ερωτήματα) — Μερικά αποδεικτικά στοιχεία.
Ερωτήσεις όπου το σώμα καλύπτει ορισμένες αλλά όχι όλες τις ζητούμενες πληροφορίες. Η σωστή συμπεριφορά είναι να διακρίνουμε ρητά τι καλύπτεται από αυτό που δεν καλύπτεται.
Κατηγορία Γ (3 ερωτήματα) — Πλήρη αποδεικτικά στοιχεία (έλεγχος).
Ερωτήσεις όπου το σώμα περιέχει την πλήρη απάντηση. Το σύστημα θα πρέπει να απαντά με επαληθεύσιμες παραπομπές.
Αποτελέσματα
20 στους 20 περαστικούς. Μηδενικές παραισθήσεις και στις τρεις κατηγορίες.
Σε κάθε ερώτημα που αναφέρεται σε ανύπαρκτα στοιχεία, η Reecopedia δήλωνε ρητά την απουσία. Χωρίς κατασκευασμένους αριθμούς άρθρων. Χωρίς επινοημένα όρια. Χωρίς παραπομπές σε έγγραφα που δεν υπάρχουν.
Δείγμα απάντησης στο κατασκευασμένο ερώτημα του άρθρου 47: *"Το ανακτημένο πλαίσιο δεν περιέχει το κείμενο του άρθρου 47 του κανονισμού 2024/1781 του κανονισμού ESPR, ούτε καμία διάταξη που να απαιτεί συγκεκριμένα τη γνωστοποίηση του υδατικού αποτυπώματος κλωστοϋφαντουργικών προϊόντων σύμφωνα με τον εν λόγω αριθμό άρθρου." *
Στη συνέχεια, το σύστημα παρέχει το παρακείμενο πλαίσιο που υπάρχει — το γενικό πλαίσιο του κανονισμού ESPR, την ημερομηνία δημοσίευσης, το πεδίο εφαρμογής — χωρίς να αποδίδει κανένα από αυτά στο ανύπαρκτο άρθρο 47. Η διάκριση μεταξύ «τι ζήτησε ο χρήστης» και «τι περιέχει στην πραγματικότητα το σώμα κειμένων» διατηρείται ρητά.
Σε ερωτήματα μερικών αποδεικτικών στοιχείων, το σύστημα διαχωρίστηκε καλυμμένα από ακάλυπτα μέρη με ρητή αναγνώριση κενών. Σε ερωτήματα ελέγχου, απάντησε με επαληθεύσιμες παραπομπές σε συγκεκριμένα έγγραφα, σελίδες και παραγράφους.
Γιατί αυτό έχει σημασία
Στη συμμόρφωση με τους κανονισμούς, η λειτουργία αποτυχίας δεν είναι "ο χρήστης έκανε μια ερώτηση και δεν πήρε απάντηση". Η λειτουργία αποτυχίας είναι "ο χρήστης έκανε μια ερώτηση, πήρε μια σίγουρη λάθος απάντηση και πήρε μια επιχειρηματική απόφαση με βάση αυτήν".
Μια επωνυμία που δηλώνει ανακυκλωμένο περιεχόμενο με βάση μια ψευδαίσθηση ερμηνείας του ESPR αντιμετωπίζει κίνδυνο επιβολής. Μια δικηγορική εταιρεία που συντάσσει ένα σημείωμα πελάτη αναφέροντας έναν επινοημένο αριθμό προϊόντος αντιμετωπίζει έκθεση σε κακή πρακτική. Ένας υπεύθυνος βιωσιμότητας που εγκρίνει έναν ισχυρισμό προμηθευτή με βάση ένα κατασκευασμένο όριο JRC είναι προσωπικά υπόλογος όταν φτάσει ο ελεγκτής.
Το παράθυρο επιβολής του ESPR του 2028 δεν θα κάνει διάκριση μεταξύ «η τεχνητή νοημοσύνη ήταν λάθος» και «η απόφασή μας ήταν λάθος». Θα ρωτήσει μόνο εάν η δήλωση τεκμηριώθηκε με επαληθεύσιμα στοιχεία.
Το πλαίσιο του Altman — πάντα να απαντάς, ποτέ να μην λες ότι δεν ξέρω — είναι δομικά ασύμβατο με αυτήν την πραγματικότητα. Λειτουργεί για την αναζήτηση των καταναλωτών, όπου μια λάθος απάντηση είναι μια μικρή ταλαιπωρία. Αποτυγχάνει σε κλάδους B2B όπου μια λάθος απάντηση είναι μια υπογεγραμμένη δέσμευση.
Η μεθοδολογία είναι δημόσια
Τα δέκα ερωτήματα δημοσιεύονται. Οι απαντήσεις είναι αναπαραγώγιμες. Οποιοσδήποτε μπορεί να εκτελέσει το ίδιο σημείο αναφοράς έναντι οποιουδήποτε συστήματος RAG που ισχυρίζεται ότι χειρίζεται ρυθμιστικό περιεχόμενο της ΕΕ. Εάν οι ανταγωνιστές θέλουν να επιδείξουν την ίδια ιδιότητα στο ίδιο σύνολο δοκιμών, καλωσορίζουμε τη σύγκριση.
Τα τεχνουργήματα αναφοράς θα δημοσιευτούν στο GitHub ως ανοιχτό σύνολο αξιολόγησης για ρυθμιστικά συστήματα RAG. Χωρίς gatekeeping, χωρίς ιδιόκτητο πλαίσιο. Εάν ο κλάδος θέλει να δημιουργήσει RAG για συμμόρφωση, μπορεί να δανειστεί το σύνολο δοκιμών.
Μια σημείωση για το τι είναι αυτό και τι δεν είναι
Δεν διεκδικώ μηδενικές παραισθήσεις σε όλα τα πιθανά ερωτήματα. Διεκδικώ μηδενικές παραισθήσεις σε ένα συγκεκριμένο, ελεγχόμενο σύνολο δοκιμών που καλύπτει τον ρυθμιστικό τομέα της ΕΕ για τα κλωστοϋφαντουργικά προϊόντα. Αυτή είναι μια συγκεκριμένη για τον τομέα, μετρήσιμη ιδιότητα — όχι ένας καθολικός ισχυρισμός μάρκετινγκ.
Η διάκριση έχει σημασία. Όσο ισχύουν τα αποτελέσματα, μπορώ να πω ότι έχω φτιάξει ένα προϊόν που είναι χρήσιμο και υγιεινό.
Η Reecopedia είναι ζωντανή στο ia.reeco.eco. Εγγενής υποστήριξη για 32 γλώσσες, δυνατότητα δυναμικής απόκρισης σε 110+. Ενδιάμεσο με 20€/μήνα, Expert με 100€/μήνα, δωρεάν δημόσια βαθμίδα.
Κατασκευάστηκε στο Πράτο της Ιταλίας. Για ερευνητές, δικηγορικά γραφεία, δημόσιες αρχές, τμήματα βιωσιμότητας, τράπεζες, μάρκες, προμηθευτές — οποιονδήποτε του οποίου οι αποφάσεις έχουν βαρύτητα.
Στέφανο Τσιπριάνι
Ιδρυτής, Reeco · Εμπειρογνώμονας CIRPASS-2 · Εγγεγραμμένος ενδιαφερόμενος στο JRC
Ευχαριστώ για την ανάγνωση! Εγγραφείτε δωρεάν για να λαμβάνετε νέες αναρτήσεις και να υποστηρίζετε τη δουλειά μου.