Η Hugging Face ανακοίνωσε στις 22 Σεπτεμβρίου μια νέα δυνατότητα στη βιβλιοθήκη Transformers: αποδοτική εκτέλεση κβαντισμένων μοντέλων GGUF σε Apple Silicon. Η υλοποίηση αξιοποιεί υπολογιστικούς πυρήνες της βιβλιοθήκης ggml, που χρησιμοποιεί και το llama.cpp.
Για τους developers, αυτό σημαίνει ότι μπορούν να δουλεύουν με μοντέλα GGUF μέσα στο γνώριμο περιβάλλον Python και PyTorch. Η φόρτωση γίνεται μέσω της μεθόδου from_pretrained, με την προσθήκη του ονόματος του αρχείου GGUF.
Το GGUF αποθηκεύει τα βάρη ενός μοντέλου μαζί με πληροφορίες που απαιτούνται για τη χρήση του. Υποστηρίζει επίσης κβαντισμό: αναπαράσταση αριθμητικών τιμών με λιγότερα bits, ώστε να περιορίζονται το μέγεθος και οι απαιτήσεις μνήμης. Η μείωση αυτή μπορεί να συνοδεύεται από απώλεια ακρίβειας, ανάλογα με το μοντέλο και την εργασία.
Η ουσιαστική αλλαγή είναι ότι, στα υποστηριζόμενα συστήματα, τα βάρη παραμένουν στην κβαντισμένη μορφή τους κατά την εκτέλεση. Η βελτιστοποιημένη διαδρομή χρησιμοποιεί το Metal μέσω του MPS, του μηχανισμού επιτάχυνσης της PyTorch για τις GPU της Apple. Σε μη υποστηριζόμενες περιπτώσεις, η φόρτωση μπορεί να μετατρέψει τα βάρη σε μορφή μεγαλύτερης ακρίβειας, καταναλώνοντας περισσότερη μνήμη.
Η αρχική υποστήριξη επικεντρώνεται στην οικογένεια Qwen3.5. Η ανακοίνωση περιλαμβάνει τις πυκνές αρχιτεκτονικές και τα μοντέλα mixture-of-experts, που ενεργοποιούν επιλεγμένα υποσύνολα παραμέτρων, καθώς και συμβατά αρχεία Qwen3.8. Παραμένουν περιορισμοί στην ταυτόχρονη επεξεργασία πολλών αιτημάτων.
Στις δοκιμές της Hugging Face, σε MacBook Pro M2 Max με 32 GB μνήμης, οι επιδόσεις πλησίασαν το llama.cpp. Ωστόσο, οι συνθήκες μέτρησης δεν ήταν πανομοιότυπες, επομένως τα αποτελέσματα δεν αποδεικνύουν ισοδύναμη απόδοση σε κάθε χρήση.
Για όποιον αναπτύσσει εφαρμογές AI, το ενδιαφέρον βρίσκεται στη δυνατότητα αξιολόγησης και τροποποίησης των μοντέλων μέσα στο ίδιο περιβάλλον ανάπτυξης. Για πρόσθετη εκπαίδευση, η τεκμηριωμένη διαδικασία μετατρέπει πρώτα τα βάρη, για παράδειγμα σε BF16. Το μικρό μέγεθος του αρχείου GGUF δεν συνεπάγεται αντίστοιχα μικρές απαιτήσεις μνήμης κατά την εκπαίδευση.
Η ίδια η Hugging Face εξακολουθεί να προτείνει το llama.cpp όταν προτεραιότητα είναι η αποδοτική τοπική εκτέλεση. Η ενσωμάτωση στα Transformers προσφέρει κυρίως περισσότερη ευελιξία στους developers που θέλουν να πειραματιστούν με τα ίδια μοντέλα.
Πηγές
- Πρωτότυπο άρθρο: Hugging Face




Φόρτωση σχολίων…