AI News · industry
Full-Duplex Voice AI: Τα μοντέλα που ακούν ενώ μιλούν
Η OpenAI, η Google, η Alibaba και η StepFun κυκλοφόρησαν τον Σεπτέμβριο του 2026 μοντέλα φωνής που μπορείτε να διακόψετε στη μέση της πρότασης. Τι άλλαξε, ποιος προηγείται σε ποιο τεστ και τι σημαίνει αυτό για τις επαγγελματικές τηλεφωνικές κλήσεις.

Το full-duplex voice AI είναι ένα ενιαίο μοντέλο που ακούει και μιλά ταυτόχρονα, ώστε ο καλών να μπορεί να το διακόψει, να κάνει παύση ή να πει "αχά" χωρίς να σπάσει η συζήτηση. Στις 7 Οκτωβρίου 2026, το GPT-Live-1 της OpenAI βρίσκεται στην κορυφή του Speech to Speech Index της Artificial Analysis με 83.2, μια ανάσα μπροστά από το Gemini 3.8 Live Extended Thinking της Google με 82.6, ενώ η κινεζική StepFun κερδίζει στο τεστ για το πόσο φυσική ακούγεται μια συζήτηση, με 98.9%. Και τα τρία κυκλοφόρησαν ή αναβαθμίστηκαν μέσα στους τελευταίους τρεις μήνες.
Αν η επιχείρησή σας απαντά τηλέφωνα, ο Σεπτέμβριος του 2026 είναι ο μήνας που άλλαξε η τεχνολογία πίσω από τις κλήσεις με AI.
Τι σημαίνει "full-duplex" και γιατί μετράει σε μια τηλεφωνική κλήση;
Οι περισσότεροι AI τηλεφωνικοί agents που φτιάχτηκαν πριν από το 2026 λειτουργούσαν σαν σκυταλοδρομία. Το speech-to-text μετέτρεπε τα λόγια του καλούντα σε κείμενο, ένα γλωσσικό μοντέλο έγραφε την απάντηση και το text-to-speech τη διάβαζε φωναχτά. Κάθε πέρασμα της σκυτάλης προσθέτει καθυστέρηση, και το σύστημα πρέπει να μαντέψει πότε ο καλών τελείωσε. Αν μαντέψει νωρίς, του μιλά από πάνω. Αν μαντέψει αργά, ακολουθεί μια αμήχανη σιωπή.
Ένα full-duplex μοντέλο ακούει και μιλά μέσα στο ίδιο δίκτυο, συνεχώς. Μπορεί να ακούσει "συγγνώμη, κάντε το τελικά Πέμπτη" ενώ είναι ακόμη στη μέση μιας πρότασης και να αλλάξει πορεία. Ξεχωρίζει τον καλούντα που σταμάτησε να μιλά από εκείνον που απλώς σκέφτεται.
Η διαφορά φαίνεται στην πράξη. Σύμφωνα με την OpenAI, η εφαρμογή εκμάθησης γλωσσών Speak μείωσε σχεδόν κατά 80% τις διακοπές στις παύσεις σκέψης των μαθητών, σε σύγκριση με τα προηγούμενα συστήματα εναλλασσόμενων γύρων. Ένας άλλος πελάτης που αναφέρεται στην ίδια ανακοίνωση, ο οποίος φτιάχνει συνομιλίες με ασθενείς, είπε ότι η μετάβαση από την αλυσιδωτή του διάταξη αφαίρεσε 23,000 γραμμές κώδικα.
Ίσως έχετε κλείσει κι εσείς το τηλέφωνο σε ένα voice bot επειδή σας έκοβε συνέχεια.
Τι κυκλοφόρησε μεταξύ Ιουλίου και Οκτωβρίου 2026;
| Μοντέλο | Εργαστήριο | Περιοχή | Βάρη | Κυκλοφορία | Τι ξεχωρίζει |
|---|---|---|---|---|---|
| GPT-Live-1 | OpenAI | ΗΠΑ | Κλειστά (API) | 10 Σεπ 2026 | Αναθέτει τη δύσκολη συλλογιστική και τις κλήσεις εργαλείων σε ξεχωριστό backend μοντέλο· υποστήριξη τηλεφωνίας |
| Gemini 3.8 Live / 3.8 Live Extended Thinking | Google DeepMind | ΗΠΑ | Κλειστά (API) | 15 Σεπ 2026 | Εκτελεί κλήσεις εργαλείων στο παρασκήνιο ενώ συνεχίζει να μιλά· 97+ γλώσσες |
| StepAudio 3 Realtime | StepFun | Κίνα | Κλειστά (API, preview) | 15 Σεπ 2026 | Η υψηλότερη βαθμολογία δυναμικής συζήτησης στην Artificial Analysis |
| Qwen-Audio-3.1-Realtime | Alibaba Qwen | Κίνα | Κλειστά (API) | Σεπ 2026 | Μείωση τιμής περίπου 85% στο realtime μοντέλο |
| Grok Voice Think Fast 2.0 | xAI | ΗΠΑ | Κλειστά (API) | 29 Ιουλ 2026 | Το υψηλότερο ποσοστό επιτυχίας εργασιών στην Artificial Analysis |
| NemotronLabs VoiceChat 11B | NVIDIA | ΗΠΑ | Ανοιχτά βάρη | Αύγ 2026 | Το πρώτο ανοιχτό full-duplex μοντέλο με κλήση εργαλείων |
| Raon-SpeechChat-9B | Krafton | Νότια Κορέα | Ανοιχτά βάρη | Απρ 2026 | Ο ταχύτερος χρόνος μέχρι τον πρώτο ήχο στον πίνακα κατάταξης (μόνο αγγλικά) |
| Step-Audio R1.1 (Realtime) | StepFun | Κίνα | Ανοιχτά βάρη | Νωρίτερα μέσα στο 2026 | Ανοιχτό μοντέλο ομιλίας πραγματικού χρόνου με ισχυρές βαθμολογίες συλλογιστικής |
Πηγές: OpenAI, Google, τεκμηρίωση της StepFun, The Decoder για το Qwen-Audio-3.1, xAI, NVIDIA στο Hugging Face, Krafton στο Hugging Face, StepFun στο Hugging Face.
Δύο μοτίβα διατρέχουν τη λίστα. Πρώτον, κάθε κορυφαίο μοντέλο ξεχωρίζει πλέον το "συνέχισε να μιλάς" από το "πήγαινε να κάνεις τη δουλειά". Το GPT-Live-1 αναθέτει τη συλλογιστική σε ένα backend μοντέλο κειμένου, το Gemini 3.8 Live καλεί εργαλεία ασύγχρονα και η StepFun περιγράφει το μοντέλο της ως μοντέλο που σκέφτεται ενώ μιλά. Δεύτερον, η κατηγορία των ανοιχτών βαρών περιλαμβάνει πια ένα full-duplex μοντέλο που μπορεί να καλεί εργαλεία στη μέση της συζήτησης, κάτι που μέχρι αυτό το καλοκαίρι πρόσφεραν μόνο τα φιλοξενούμενα API.
Ποιο μοντέλο voice AI είναι το καλύτερο αυτή τη στιγμή;
Δεν υπάρχει ένας νικητής, και όποιος σας δείχνει έναν χωρίς να πει "σε ποιο τεστ" κάτι προσπαθεί να σας πουλήσει. Η Artificial Analysis συνδυάζει τέσσερα τεστ στον δείκτη της: συλλογιστική ομιλίας, agentic απόδοση σε εργασίες εξυπηρέτησης πελατών του τ-Voice, προτίμηση στην arena και επιτυχία εργασιών. Τη δυναμική της συζήτησης τη δημοσιεύει ξεχωριστά. Στις 7 Οκτωβρίου 2026:
| Τεστ (Artificial Analysis) | Πρώτο | Βαθμολογία | Ακολουθούν κοντά |
|---|---|---|---|
| Συνολικός Speech to Speech Index | GPT-Live-1 (Astra backend, medium) | 83.2 | Gemini 3.8 Live Extended Thinking (High) 82.6· Grok Voice Think Fast 2.0 High 81.3 |
| Συλλογιστική ομιλίας (Big Bench Audio) | StepAudio 3 Realtime (StepFun) | 99.7% | Qwen Audio 3.0 Realtime Plus 99.2%· Qwen3.5 Omni Plus Realtime 98.7% |
| Agentic απόδοση (εργασίες εξυπηρέτησης πελατών τ-Voice) | GPT-Live-1 (Astra backend, medium), μία δοκιμή | 74.5% | Gemini 3.8 Live Extended Thinking (High) 68.6% |
| Δυναμική συζήτησης (παύσεις, εναλλαγή σειράς, διακοπές) | StepAudio 3 Realtime (StepFun) | 98.9% | Qwen Audio 3.0 Realtime Plus 98.4%· GPT-Live-1 (Sol, low) 97.3% |
| Επιτυχία εργασιών στο Speech Agent Arena | Grok Voice Think Fast 2.0 High | 94.6% | Gemini 3.8 Live 93.2% |
Διαβάστε τον πίνακα έτσι. Στον συνολικό δείκτη, OpenAI, Google και xAI απέχουν μεταξύ τους λιγότερο από δύο μονάδες, που στην πράξη είναι ισοπαλία. Στη συλλογιστική ομιλίας και στο πόσο φυσική ακούγεται η συζήτηση, προηγούνται τα κινεζικά μοντέλα: η StepFun και η Alibaba ξεπερνούν κάθε αμερικανικό μοντέλο και στα δύο. Το προβάδισμα της OpenAI στο τεστ εξυπηρέτησης πελατών στηρίζεται σε μία μόνο δοκιμή, οπότε θεωρήστε το προσωρινό. Και η διαφορά στην τιμή είναι πραγματική: η Artificial Analysis κατατάσσει το Qwen Audio 3.0 Realtime Plus της Alibaba ως το φθηνότερο μοντέλο που παρακολουθεί ανά ώρα ήχου εισόδου.
Σημειώστε ότι το νεότερο Qwen-Audio-3.1-Realtime της Alibaba δεν είχε ακόμη βαθμολογηθεί στον πίνακα κατάταξης όταν τον ελέγξαμε, οπότε οι γραμμές της Alibaba παραπάνω αφορούν την έκδοση 3.0.
Πού υστερούν ακόμη τα νέα μοντέλα;
Οι ανακοινώσεις κυκλοφορίας είναι αισιόδοξες. Οι πίνακες των benchmarks είναι πιο ειλικρινείς.
- Το να ακούγεσαι φυσικός και το να κάνεις τη δουλειά είναι διαφορετικές δεξιότητες. Το ανοιχτό PersonaPlex της NVIDIA πετυχαίνει 91.0% στη δυναμική συζήτησης αλλά 19% στη συλλογιστική ομιλίας, στον ίδιο πίνακα της Artificial Analysis. Ένα μοντέλο μπορεί να ακούγεται άψογα και παρ' όλα αυτά να κλείσει λάθος ραντεβού.
- Καλύτερη ακρόαση μπορεί να σημαίνει πιο αργό σταμάτημα. Τα τεχνικά αποτελέσματα της ίδιας της Alibaba, όπως τα συνοψίζει το MarkTechPost, δείχνουν ότι το μοντέλο της έγινε πολύ καλύτερο στο να αγνοεί ομιλία που δεν απευθύνεται σε αυτό. Ωστόσο, το ποσοστό ανεπιθύμητης επανέναρξης μετά από διακοπή ανέβηκε από 0.035 σε 0.130, και χρειάζεται 1.116 δευτερόλεπτα για να σταματήσει όταν το διακόπτουν, έναντι 0.383 δευτερολέπτων για το GPT-Realtime-2.
- Οι εργασίες εξυπηρέτησης πελατών δεν έχουν ακόμη λυθεί. Ακόμη και το καλύτερο μοντέλο στο τ-Voice ολοκληρώνει περίπου τρεις στις τέσσερις προσομοιωμένες εργασίες αεροπορικής, λιανικής και τηλεπικοινωνιών. Το υπόλοιπο τέταρτο αποτυγχάνει.
- Τα ανοιχτά βάρη είναι άνισα. Το ανοιχτό Step-Audio R1.1 της StepFun πετυχαίνει 97.6% στη συλλογιστική ομιλίας, ένα δέκατο της μονάδας πίσω από το καλύτερο της Google (Gemini 3.8 Live Extended Thinking, 97.7%) και πάνω από κάθε μοντέλο της OpenAI και της xAI. Κανένα ανοιχτό μοντέλο όμως δεν έχει ακόμη βαθμολογία εξυπηρέτησης πελατών στο τ-Voice, και η ανασκόπηση του AI Weekly στην κάρτα μοντέλου της NVIDIA σημειώνει ότι επιλέγει το σωστό εργαλείο στο 82.5% των περιπτώσεων αλλά συμπληρώνει σωστά τις λεπτομέρειες μόνο στο 44.2%. Ελέγξτε την άδεια χρήσης κάθε μοντέλου πριν χτίσετε πάνω του.
Τι σημαίνει αυτό για μια επιχείρηση που δέχεται κλήσεις;
Στην πράξη, το τηλέφωνο έγινε μόλις πιο αξιόπιστο κανάλι για πραγματική δουλειά, και λιγότερο ανεκτικό με τις αργές λύσεις. Η ταχύτητα ήδη κρίνει τις πωλήσεις στα μηνύματα. Στη Response Velocity Study της Entagl, οι συζητήσεις που απαντήθηκαν μέσα σε 60 δευτερόλεπτα είχαν μετατροπή 35.1%, έναντι 12.2% όταν η απάντηση ήρθε σε 5 έως 60 λεπτά, σε σύνολο 32,581 συζητήσεων. Το τηλέφωνο είναι το πιο ανυπόμονο κανάλι που υπάρχει.
Τρία πράγματα να κάνετε με αυτά τα νέα:
- Δοκιμάστε τις διακοπές, όχι τα demo. Καλέστε τον AI agent σας και κόψτε τον στη μέση της πρότασης, αλλάξτε την ημερομηνία στα μισά, μείνετε σιωπηλοί για τέσσερα δευτερόλεπτα. Ο οδηγός μας για την αξιολόγηση ενός AI τηλεφωνικού agent απαριθμεί τα σενάρια που αξίζει να τρέξετε.
- Κρίνετε την ενέργεια, όχι τη φωνή. Μια ευχάριστη φωνή που κλείνει λάθος ώρα είναι χειρότερη από μια απλή φωνή που κλείνει τη σωστή. Βεβαιωθείτε ότι το ραντεβού, η παραγγελία ή η επανάκληση καταγράφεται πράγματι στο σύστημά σας.
- Μη δεθείτε με ένα μόνο μοντέλο φωνής. Στις 15 Σεπτεμβρίου η Google ανακοίνωσε ότι το Gemini 3.8 Live Extended Thinking ήταν #1 στον δείκτη της Artificial Analysis. Τρεις εβδομάδες αργότερα, το GPT-Live-1 βρίσκεται 0.6 μονάδες πάνω του. Εξηγήσαμε το γενικό σκεπτικό στο άρθρο γιατί δεν πρέπει να χτίσετε την επιχείρησή σας πάνω σε ένα μόνο μοντέλο AI, και στη φωνή αυτό πονάει περισσότερο από οπουδήποτε αλλού.
Πού ταιριάζει ο Coordinator της Entagl;
Ο Coordinator της Entagl διαχειρίζεται εισερχόμενες και εξερχόμενες κλήσεις μέσω τηλεφωνικών αριθμών και κλήσεων WhatsApp (σε υποστηριζόμενους αριθμούς και με την άδεια του πελάτη όπου το απαιτεί το WhatsApp), χρησιμοποιώντας εγγενή speech-to-speech μοντέλα αντί για αλυσιδωτή σκυταλοδρομία. Το φωνητικό του επίπεδο είναι σχεδιασμένο ώστε να αλλάζει το υποκείμενο μοντέλο χωρίς να χρειάζεται να ξαναστηθεί ο agent: το Gemini Live τρέχει από προεπιλογή, και τα realtime μοντέλα της OpenAI έρχονται σταδιακά ως δεύτερη επιλογή. Πριν καλέσει, διαβάζει περιλήψεις των πρόσφατων συζητήσεων του πελάτη, τα ραντεβού του και τις προηγούμενες κλήσεις, ώστε μια κλήση επιβεβαίωσης ή μια επανάκληση που ζητήθηκε να ξεκινά με πλαίσιο και όχι με ένα "πώς μπορώ να σας βοηθήσω;". Κάθε κλήση αφήνει ένα απομαγνητοφωνημένο κείμενο στο αρχείο του πελάτη.
Για το πού ταιριάζουν οι κλήσεις σε όλη τη διαδρομή του πελάτη, δείτε το AI voice για εξυπηρέτηση πελατών και πωλήσεις. Για την πιο συνηθισμένη χρήση, η σύνοψη ερευνών μας για τις αδικαιολόγητες απουσίες εξετάζει τι αλλάζουν στην πράξη οι κλήσεις επιβεβαίωσης.
Θέλετε να ακούσετε πώς ακούγεται μια κλήση AI με πλήρες πλαίσιο στη δική σας περίπτωση; Κλείστε ένα demo 30 λεπτών.
FAQ
Ποια είναι η διαφορά ανάμεσα σε full-duplex και half-duplex voice AI;
Το half-duplex voice AI (με εναλλασσόμενους γύρους) μιλά με τη σειρά: περιμένει να σταματήσετε και μετά απαντά. Το full-duplex voice AI ακούει και μιλά ταυτόχρονα, οπότε μπορεί να αντιδράσει σε διακοπές, σε επιβεβαιωτικά επιφωνήματα όπως το "μμ-χμ" και σε παύσεις ενώ ακόμη μιλά.
Ποιο είναι το καλύτερο μοντέλο AI φωνής τον Οκτώβριο του 2026;
Εξαρτάται από το τεστ. Στην Artificial Analysis, στις 7 Οκτωβρίου 2026, το GPT-Live-1 προηγείται στον συνολικό Speech to Speech Index με 83.2, οριακά μπροστά από το Gemini 3.8 Live Extended Thinking (82.6) και το Grok Voice Think Fast 2.0 (81.3). Το StepAudio 3 Realtime της StepFun προηγείται στη δυναμική συζήτησης με 98.9%.
Υπάρχουν full-duplex μοντέλα φωνής ανοιχτού κώδικα;
Ναι. Η NVIDIA περιγράφει το NemotronLabs VoiceChat 11B ως το πρώτο ανοιχτό full-duplex μοντέλο με κλήση εργαλείων, το Raon-SpeechChat-9B της Krafton είναι ανοιχτό και μόνο για αγγλικά, και η StepFun δημοσιεύει τα βάρη του Step-Audio R1.1. Η συλλογιστική τους μπορεί να είναι ισχυρή, αλλά κανένα δεν έχει ακόμη βαθμολογηθεί στο benchmark εξυπηρέτησης πελατών τ-Voice, και οι άδειες χρήσης διαφέρουν, οπότε ελέγξτε τους όρους πριν χτίσετε.
Κάνουν τα full-duplex μοντέλα τους AI τηλεφωνικούς agents έτοιμους για κάθε κλήση;
Όχι. Το καλύτερο μοντέλο στο benchmark εξυπηρέτησης πελατών τ-Voice ολοκληρώνει το 74.5% των εργασιών, με βάση μία δοκιμή. Κρατήστε έναν σαφή δρόμο προς έναν άνθρωπο και ελέγξτε τις ενέργειες που κάνει ο agent, όχι μόνο το πώς ακούγεται.
Χρειάζεται μια επιχείρηση να διαλέξει ένα από αυτά τα μοντέλα;
Συνήθως όχι άμεσα. Η κορυφή του πίνακα κατάταξης άλλαξε χέρια μέσα σε τρεις εβδομάδες από την κυκλοφορία της Google στις 15 Σεπτεμβρίου, οπότε η ασφαλέστερη λύση είναι μια πλατφόρμα της οποίας το φωνητικό επίπεδο μπορεί να μεταφερθεί σε άλλο μοντέλο χωρίς να ξαναστηθεί ο agent, και της οποίας τις υποστηριζόμενες επιλογές ελέγχετε πριν δεσμευτείτε.
Πηγές: σελίδες προϊόντων και κάρτες μοντέλων των OpenAI, Google DeepMind, StepFun, xAI, NVIDIA και Krafton· πίνακας κατάταξης Speech to Speech της Artificial Analysis (έλεγχος στις 7 Οκτωβρίου 2026)· The Decoder (23 Σεπτεμβρίου 2026)· MarkTechPost (28 Σεπτεμβρίου 2026)· AI Weekly (Αύγουστος 2026)· Entagl Response Velocity Study (2026).