Η Τεχνητή Νοημοσύνη δεν είναι μόνο το ChatGPT
Η Τεχνητή Νοημοσύνη έχει μπει πλέον για τα καλά στη ζωή μας.
Πέρασε η εποχή που, όταν θέλαμε να βρούμε μια πληροφορία, η πρώτη μας κίνηση ήταν να ανοίξουμε μια μηχανή αναζήτησης, να γράψουμε μερικές λέξεις και να αρχίσουμε να ψάχνουμε μέσα σε δεκάδες διαφορετικές σελίδες.
Σήμερα όλο και περισσότεροι ανοίγουμε το ChatGPT, το Claude, το Gemini ή κάποιο άλλο εργαλείο Τεχνητής Νοημοσύνης και απλά ρωτάμε αυτό που θέλουμε να μάθουμε.
Για τον περισσότερο κόσμο, αυτή ήταν και η πρώτη πραγματική επαφή με την Τεχνητή Νοημοσύνη.
Τα συστήματα αυτά βασίζονται σε μεγάλο βαθμό στα λεγόμενα LLMs, Large Language Models, ή στα ελληνικά Μεγάλα Γλωσσικά Μοντέλα.
Τι είναι ένα LLM;
Ένα Μεγάλο Γλωσσικό Μοντέλο είναι ένα μοντέλο Τεχνητής Νοημοσύνης που έχει εκπαιδευτεί πάνω σε τεράστιες ποσότητες κειμένου ώστε να μπορεί να κατανοεί και να παράγει ανθρώπινη γλώσσα.
Μπορεί να απαντά σε ερωτήσεις, να γράφει κείμενα, να συνοψίζει πληροφορίες, να μεταφράζει, να αναλύει δεδομένα, να βοηθά στον προγραμματισμό και να εκτελεί πολλές ακόμη εργασίες που σχετίζονται με τη γλώσσα και τη γνώση.
Περισσότερες τεχνικές πληροφορίες μπορεί κάποιος να βρει και στη Wikipedia.
Τα LLMs όμως είναι μόνο ένα κομμάτι της Τεχνητής Νοημοσύνης.
Και εδώ βρίσκεται ίσως η μεγαλύτερη παρεξήγηση που υπάρχει σήμερα γύρω από το AI.
Όταν λέμε «Τεχνητή Νοημοσύνη», δεν εννοούμε μόνο ένα chatbot που γράφει κείμενο.
Υπάρχουν πολλά διαφορετικά μοντέλα και συστήματα AI που έχουν δημιουργηθεί για διαφορετικές εργασίες.
Παραγωγική Τεχνητή Νοημοσύνη
Η Παραγωγική Τεχνητή Νοημοσύνη, Generative AI, είναι η κατηγορία συστημάτων που μπορούν να δημιουργούν νέο περιεχόμενο.
Αυτό το περιεχόμενο μπορεί να είναι κείμενο, εικόνα, βίντεο, μουσική, φωνή ή ακόμη και κώδικας προγραμματισμού.
| Τύπος AI | Τι κάνει | Γνωστά παραδείγματα |
|---|---|---|
| Μεγάλα Γλωσσικά Μοντέλα (LLMs) | Κατανοούν και παράγουν ανθρώπινη γλώσσα. Μπορούν να απαντούν σε ερωτήσεις, να γράφουν, να αναλύουν και να συνοψίζουν κείμενα. | ChatGPT, Claude, Gemini |
| Μοντέλα Παραγωγής Εικόνας (Text-to-Image) | Μετατρέπουν γραπτές περιγραφές σε εικόνες και γραφικά. | Midjourney, OpenAI Images, Stable Diffusion |
| Μοντέλα Παραγωγής Βίντεο (Text-to-Video) | Δημιουργούν βίντεο και animations χρησιμοποιώντας περιγραφές κειμένου ή εικόνες. | OpenAI Sora, Runway, Pika |
| AI Ήχου και Μουσικής | Δημιουργεί μουσική, φωνή και ηχητικά εφέ ή μετατρέπει φωνή σε κείμενο. | Suno, Udio, OpenAI Whisper |
| AI για Προγραμματισμό | Βοηθά στη συγγραφή, διόρθωση, ανάλυση και επεξήγηση κώδικα. | GitHub Copilot, ChatGPT, Claude |
Όμως ακόμη και η Generative AI είναι μόνο ένα μέρος του συνολικού κόσμου της Τεχνητής Νοημοσύνης.
Άλλα είδη έχουμε..
Υπολογιστική Όραση
Η Υπολογιστική Όραση, Computer Vision, αφορά συστήματα Τεχνητής Νοημοσύνης που μπορούν να αναλύουν εικόνες και βίντεο και να καταλαβαίνουν τι υπάρχει μέσα σε αυτά.
Ένα τέτοιο σύστημα μπορεί, για παράδειγμα, να αναγνωρίσει έναν άνθρωπο, ένα αυτοκίνητο, ένα αντικείμενο, ένα ζώο ή μια πινακίδα κυκλοφορίας.
Μπορεί επίσης να εντοπίσει πού βρίσκεται ένα αντικείμενο μέσα σε μια εικόνα, να παρακολουθήσει την κίνησή του ή να αναγνωρίσει συγκεκριμένα χαρακτηριστικά.
Τεχνολογίες Computer Vision χρησιμοποιούνται ήδη σε κινητά τηλέφωνα, συστήματα ασφαλείας, εργοστάσια, ιατρικές εφαρμογές, αυτόνομα οχήματα και πολλές άλλες εφαρμογές.
Η αναγνώριση προσώπου στο κινητό μας είναι ένα απλό παράδειγμα Computer Vision.
Πολυτροπικά συστήματα AI
Τα πρώτα γλωσσικά μοντέλα επικεντρώνονταν κυρίως στο κείμενο.
Τα σύγχρονα συστήματα Τεχνητής Νοημοσύνης όμως μπορούν πλέον να επεξεργάζονται πολλές διαφορετικές μορφές πληροφορίας.
Αυτή η δυνατότητα ονομάζεται Multimodal AI, δηλαδή πολυτροπική Τεχνητή Νοημοσύνη.
Ένα πολυτροπικό σύστημα μπορεί να επεξεργάζεται ταυτόχρονα κείμενο, εικόνες, ήχο και σε ορισμένες περιπτώσεις βίντεο.
Για παράδειγμα, μπορείς να του δείξεις μια φωτογραφία και να το ρωτήσεις τι βλέπει.
Μπορείς να του δώσεις ένα έγγραφο και να του ζητήσεις να το αναλύσει.
Μπορείς να μιλήσεις μαζί του χρησιμοποιώντας τη φωνή σου ή να του δώσεις εικόνες και κείμενο ταυτόχρονα ώστε να συνδυάσει τις πληροφορίες.
Το Multimodal AI λοιπόν δεν είναι απαραίτητα ένα ξεχωριστό είδος Τεχνητής Νοημοσύνης. Είναι περισσότερο μια δυνατότητα που επιτρέπει σε ένα σύστημα να καταλαβαίνει και να συνδυάζει διαφορετικούς τύπους δεδομένων.
Αυτός είναι και ο λόγος που η γραμμή ανάμεσα στα γλωσσικά μοντέλα, το Computer Vision, την αναγνώριση ήχου και άλλες τεχνολογίες αρχίζει να γίνεται όλο και λιγότερο ξεκάθαρη.
Τα σύγχρονα συστήματα AI μπορούν πλέον να συνδυάζουν πολλές από αυτές τις δυνατότητες μέσα στο ίδιο περιβάλλον.
Η Φυσική Τεχνητή Νοημοσύνη
Ένας ακόμη πιο ενδιαφέρων τομέας είναι η λεγόμενη Physical AI, η Τεχνητή Νοημοσύνη που μπορεί να αντιλαμβάνεται και να αλληλεπιδρά με τον πραγματικό φυσικό κόσμο.
Εδώ η Τεχνητή Νοημοσύνη βγαίνει ουσιαστικά από την οθόνη και αρχίζει να συνδέεται με μηχανές, ρομπότ, οχήματα και αισθητήρες.
Ένα chatbot μπορεί να σου εξηγήσει πώς να σηκώσεις ένα αντικείμενο.
Ένα σύστημα Physical AI μπορεί να δει το αντικείμενο, να καταλάβει πού βρίσκεται, να υπολογίσει πώς πρέπει να κινηθεί και τελικά να το σηκώσει χρησιμοποιώντας ένα ρομποτικό χέρι.
Η Physical AI συνδυάζει πολλές διαφορετικές τεχνολογίες Τεχνητής Νοημοσύνης με κάμερες, αισθητήρες, κινητήρες και μηχανικά συστήματα.
Πώς λειτουργεί η Physical AI;
Αντίληψη
Το σύστημα πρέπει αρχικά να αντιλαμβάνεται τι συμβαίνει γύρω του.
Χρησιμοποιεί κάμερες, μικρόφωνα, radar, αισθητήρες ή συστήματα LiDAR ώστε να συλλέγει πληροφορίες για το περιβάλλον.
Μέσω τεχνολογιών όπως το Computer Vision μπορεί να αναγνωρίζει ανθρώπους, αντικείμενα, εμπόδια, δρόμους και άλλες πληροφορίες που υπάρχουν γύρω του.
Κατανόηση και λήψη αποφάσεων
Στη συνέχεια πρέπει να επεξεργαστεί αυτές τις πληροφορίες και να αποφασίσει τι πρέπει να κάνει.
Για παράδειγμα, ένα ρομπότ μπορεί να καταλάβει ότι μπροστά του υπάρχει ένα τραπέζι, ότι πάνω στο τραπέζι βρίσκεται ένα ποτήρι και ότι πρέπει να κινηθεί με συγκεκριμένο τρόπο για να το πιάσει.
Ένα αυτόνομο όχημα αντίστοιχα πρέπει να καταλάβει ότι μπροστά του υπάρχει ένας πεζός, ένα άλλο αυτοκίνητο ή ένα φανάρι και να αποφασίσει πώς πρέπει να αντιδράσει.
Κατανόηση του φυσικού κόσμου
Ένα σύστημα που δρα στον πραγματικό κόσμο πρέπει επίσης να μπορεί να προβλέπει, σε κάποιο βαθμό, το αποτέλεσμα των ενεργειών του.
Πρέπει να λαμβάνει υπόψη πράγματα όπως η απόσταση, η ταχύτητα, η κίνηση των αντικειμένων, η βαρύτητα, η τριβή και η ισορροπία.
Αν ένα ρομπότ πρόκειται να πιάσει ένα ποτήρι, για παράδειγμα, δεν αρκεί απλώς να γνωρίζει ότι το αντικείμενο είναι ένα ποτήρι.
Πρέπει να υπολογίσει πού βρίσκεται, πόση δύναμη πρέπει να χρησιμοποιήσει και πώς να το μετακινήσει χωρίς να το ρίξει ή να το σπάσει.
Δράση
Το τελευταίο βήμα είναι η πραγματική δράση.
Το σύστημα μετατρέπει την απόφασή του σε κίνηση μέσω κινητήρων, τροχών, ρομποτικών βραχιόνων ή άλλων μηχανικών συστημάτων.
Αυτό μπορεί να σημαίνει ότι ένα ρομπότ περπατάει, σηκώνει ένα αντικείμενο, μεταφέρει ένα προϊόν ή ότι ένα αυτόνομο όχημα στρίβει, επιταχύνει ή φρενάρει.
Παραδείγματα Physical AI
Ανθρωποειδή ρομπότ
Ρομπότ σχεδιασμένα ώστε να μπορούν να κινούνται και να εκτελούν εργασίες μέσα σε χώρους που έχουν δημιουργηθεί για ανθρώπους.
Μπορούν, για παράδειγμα, να περπατούν, να μεταφέρουν αντικείμενα ή να χρησιμοποιούν εργαλεία.
Βιομηχανικά και αυτόνομα ρομπότ
Συστήματα που χρησιμοποιούνται σε εργοστάσια, αποθήκες και κέντρα διανομής για τη μεταφορά προϊόντων, τη συναρμολόγηση εξαρτημάτων και την αυτοματοποίηση εργασιών.
Αυτόνομα οχήματα
Αυτοκίνητα και robotaxi που χρησιμοποιούν κάμερες, radar, LiDAR και AI για να αντιλαμβάνονται τον δρόμο και να παίρνουν αποφάσεις σε πραγματικό χρόνο.
Drones και έξυπνος εξοπλισμός
Αυτόνομα ή ημιαυτόνομα συστήματα που μπορούν να χρησιμοποιηθούν στη γεωργία, στις κατασκευές, στη χαρτογράφηση, στην επιθεώρηση εγκαταστάσεων και σε πολλές ακόμη εφαρμογές.
Η Τεχνητή Νοημοσύνη είναι πολύ μεγαλύτερη από ένα chatbot
Όταν σήμερα ακούμε τη λέξη AI, το μυαλό των περισσότερων πηγαίνει αμέσως στο ChatGPT.
Είναι λογικό, γιατί τα chatbots ήταν ο τρόπος με τον οποίο εκατομμύρια άνθρωποι γνώρισαν για πρώτη φορά από κοντά τις δυνατότητες της Τεχνητής Νοημοσύνης.
Όμως αυτό που βλέπουμε μέσα σε ένα chatbot είναι μόνο ένα μέρος μιας πολύ μεγαλύτερης τεχνολογικής εξέλιξης.
Η Τεχνητή Νοημοσύνη μπορεί να γράφει κείμενο, να δημιουργεί εικόνες και βίντεο, να παράγει μουσική, να αναγνωρίζει αντικείμενα, να καταλαβαίνει εικόνες και ήχο και να ελέγχει μηχανές που κινούνται στον πραγματικό κόσμο.
Και το πιο ενδιαφέρον είναι ότι αυτές οι τεχνολογίες δεν εξελίσσονται πλέον ανεξάρτητα η μία από την άλλη.
Αρχίζουν να συνδυάζονται.
Ένα μελλοντικό ρομπότ, για παράδειγμα, μπορεί να χρησιμοποιεί Computer Vision για να βλέπει, ένα γλωσσικό μοντέλο για να καταλαβαίνει τι του ζητάμε, αισθητήρες για να αντιλαμβάνεται το περιβάλλον του και ένα σύστημα ελέγχου για να μετατρέπει τις αποφάσεις του σε πραγματικές κινήσεις.
Ίσως λοιπόν η μεγάλη αλλαγή που έρχεται να μην είναι απλώς ότι θα έχουμε καλύτερα chatbots.
Η πραγματική αλλαγή μπορεί να είναι ότι η Τεχνητή Νοημοσύνη θα αρχίσει σταδιακά να περνά από τον ψηφιακό κόσμο στον πραγματικό.




Φόρτωση σχολίων…