TL;DR
- Vapi facture 0,05 $/minute pour l'orchestration mais le total réel monte entre 0,13 et 0,33 $/minute une fois les fournisseurs additionnels branchés (STT, LLM, voix, télécom).
- Retell facture 0,07 $/minute tout compris voice engine, avec un coût production typique entre 0,13 et 0,31 $/minute. Moins de fournisseurs à câbler.
- Sur la latence, Retell sort de la boîte plus rapide (médiane 600 à 800 ms). Vapi peut faire aussi bien (500 à 700 ms) mais demande un tuning manuel précis. Sous charge, les deux dépassent 1,5 s en P95, seuil où le client raccroche.
- Pour un agent vocal en français de qualité PME, le moteur ElevenLabs change tout. Vapi le supporte nativement, Retell s'appuie sur sa stack interne. Avantage Vapi sur le timbre.
- Côté RGPD, aucun des deux n'est EU-native. Les serveurs sont aux États-Unis, la donnée vocale transite par les USA et tombe sous le CLOUD Act. Les deux fournissent un DPA, ni l'un ni l'autre une résidence stricte UE par défaut.
- Verdict ATTA : Retell pour démarrer vite et simple, Vapi pour les cas où la qualité de voix française et la flexibilité du stack pèsent plus lourd que la simplicité d'installation.
Pourquoi ce comparatif
Vapi et Retell sont devenus en 2025-2026 les deux plateformes les plus citées dès qu'on parle d'agent vocal IA pour PME. Avant elles, le marché était partagé entre solutions enterprise lourdes (Genesys, NICE) et bots vocaux limités au scripting simple. Vapi et Retell ont popularisé une troisième voie : un agent qui comprend, qui parle de façon convaincante, et qui se branche sur un téléphone réel en quelques heures.
Pour une PME wallonne (artisan, cabinet de service, agence immobilière), la question concrète n'est pas « lequel est le meilleur dans l'absolu », c'est « lequel encaisse mieux mon cas d'usage ». Ce sont rarement les mêmes critères.
Cet article repose sur deux choses : les sources publiques sur les deux plateformes (pricing, docs, benchmarks tiers), et l'expérience terrain sur le cas client installateur de châssis du Brabant wallon où on a installé un agent vocal qui prend les rendez-vous à la place du gérant en intervention. Pas de chiffre inventé : ce qu'on a vu, on le dit. Le reste, on l'a sourcé.
Vue d'ensemble
Vapi en deux phrases
Plateforme américaine fondée en 2020. Approche modulaire : Vapi orchestre les briques (STT, LLM, TTS, télécom) que vous choisissez chez des tiers (Deepgram, OpenAI, Anthropic, ElevenLabs, Twilio). Forte capacité de personnalisation, courbe d'apprentissage plus exigeante.
Retell en deux phrases
Plateforme américaine plus récente (2023), centrée sur la simplicité d'usage. Approche intégrée : Retell fournit son propre voice engine optimisé, avec un branchement direct sur Twilio et les principaux CRM. Moins de leviers de tuning, plus de rapidité d'installation.
Tableau comparatif synthétique
| Critère | Vapi | Retell | Verdict |
|---|---|---|---|
| Prix annoncé | 0,05 $/min orchestration | 0,07 $/min usage | Retell plus simple à lire |
| Prix total typique | 0,13 à 0,33 $/min | 0,13 à 0,31 $/min | Quasi-égalité |
| Nombre de fournisseurs à câbler | 4 à 6 (STT, LLM, TTS, télécom, etc.) | 1 ou 2 (telecom + LLM) | Retell |
| Plan d'entrée | 60 min offertes, 10 lignes | 10 $ de crédit, 20 lignes gratuites | Retell |
| Latence standard | 700 à 1 500 ms | 600 à 800 ms | Retell |
| Latence tunée | 500 à 700 ms (Deepgram + GPT-4o-mini + ElevenLabs Flash) | sub-500 ms revendiqué, 720 ms mesuré | Quasi-égalité après tuning |
| P95 sous charge | > 1,5 s | > 1,5 s | Les deux, seuil de raccrochage atteint |
| Qualité voix française | Excellente via ElevenLabs natif | Bonne via stack interne | Vapi |
| Flow builder visuel | Oui (Flow Studio drag-and-drop) | Oui (interface intégrée) | Quasi-égalité |
| Intégrations CRM | 40+ apps via function calling | Twilio, HubSpot, Salesforce, Make, n8n out-of-box | Retell |
| Hébergement par défaut | USA | USA | Égalité |
| RGPD | DPA disponible, EU-aware | DPA disponible, EU-aware | Égalité |
| Résidence UE par défaut | Non | Non | Aucun gagnant |
| Documentation et exemples | Vaste, mais éclatée | Plus concise, plus prête-à-l'emploi | Retell |
| Communauté | Forte, plus technique | Plus petite, plus produit | Vapi |
Sources : vapi.ai/pricing, retellai.com/pricing, trillet.ai benchmarks 2026. Données du 20 juin 2026.
Le prix réel d'un agent vocal en production
C'est le point que les fiches commerciales rendent confus à dessein. Voici la vérité chiffrée.
Vapi : le piège du prix d'appel
Le tarif communiqué partout est 0,05 $/minute. C'est vrai pour la couche d'orchestration. Mais un appel vocal réel a besoin de plus que ça :
- Speech-to-Text (STT) : Vapi vous renvoie chez Deepgram ou AssemblyAI. Compter 0,005 à 0,015 $/minute selon le moteur.
- Large Language Model (LLM) : Vapi se branche sur OpenAI, Anthropic, ou Together AI. Compter 0,02 à 0,15 $/minute selon le modèle (GPT-4o-mini est l'optimum coût/qualité fin 2025).
- Text-to-Speech (TTS) : si vous voulez de l'ElevenLabs pour la voix française, c'est 0,18 à 0,30 $/minute en moyenne pour la qualité production.
- Télécom (Twilio ou SIP) : 0,01 à 0,03 $/minute selon la zone d'appel.
Total typique : entre 0,21 et 0,53 $/minute pour un agent en français de qualité. Pour 1 000 minutes d'appels par mois, ça se traduit en 210 à 530 $ de facture. La page officielle vapi.ai/pricing reconnaît implicitement cette structure en mentionnant les fournisseurs tiers.
Retell : moins de surprises sur la facture
Retell a fait le choix inverse. Son pricing officiel annonce 0,07 $/minute usage, sans abonnement, et le voice engine est inclus (pas besoin d'aller chercher ElevenLabs séparément pour la TTS standard). Il faut quand même ajouter :
- LLM : passage par OpenAI, Anthropic, etc. Compter la même fourchette 0,02 à 0,15 $/minute.
- Télécom : Twilio ou opérateur, 0,01 à 0,03 $/minute.
Total typique production : entre 0,10 et 0,25 $/minute pour la majorité des cas PME. La couche "voice + LLM" est plus simple à provisionner que chez Vapi, ce qui rend la facture plus prévisible.
Le piège enterprise
Vapi communique sur sa page que les déploiements production sérieux tournent autour de 40 000 à 70 000 $ par an pour des opérations stables (volumes très élevés, lignes multiples, support 24/7, conformité HIPAA). Retell joue dans la même cour en enterprise mais sa grille est moins transparente publiquement, il faut demander un devis.
Pour une PME wallonne avec 500 à 2 000 minutes d'appels par mois, on est très loin de ces tarifs. Le ticket réel se compte en dizaines à quelques centaines d'euros par mois.
Le 0,05 $/minute de Vapi et le 0,07 $/minute de Retell ne disent pas la même chose. Chez Vapi, c'est de l'orchestration nue, vous payez en plus la voix française, le LLM, le télécom et la STT. Chez Retell, le voice engine est inclus. Pour une PME en démarrage, la facture Retell est plus simple à anticiper.
Latence : où ça se joue vraiment
Un agent vocal qui prend 2 secondes à répondre est mort. Le seuil humain de tolérance dans une conversation téléphonique tourne autour de 1 seconde. Au-delà, l'interlocuteur sent qu'il parle à une machine, ou raccroche.
Les chiffres publics
Selon les benchmarks Trillet de 2026, Retell sort de la boîte avec une latence médiane de 600 à 800 ms. Vapi est plus disparate : 700 à 1 500 ms en configuration standard, et 500 à 700 ms après tuning (combinaison Deepgram pour la STT, GPT-4o-mini pour le LLM, ElevenLabs Flash pour la TTS).
Le point critique que les benchmarks oublient souvent : sous charge réelle (10 appels simultanés sur un même compte), les deux plateformes dépassent 1,5 seconde en P95. C'est exactement le moment où un client en attente sur un appel raccroche. La capacité à tenir la latence en pic est plus prédictive de la qualité d'expérience que la latence médiane communiquée en marketing.
Ce qu'on observe en mission
Sur le cas client châssis, l'expérience montre deux choses :
- La latence absolue importe moins que la stabilité de la latence. Une médiane à 800 ms qui ne bouge pas vaut mieux qu'une médiane à 500 ms qui pique à 2,5 s sur 20 % des appels.
- La perception de latence dépend aussi de la gestion du barge-in (quand l'humain coupe la parole à l'agent). Retell gère ça bien out-of-the-box, Vapi demande de la config. Sur un agent francophone qui doit gérer des questions interruptives, ce détail change l'engagement.
Le tuning Vapi qui marche
Pour une PME qui a un développeur ou un partenaire d'intégration, la combinaison Vapi qui tient la route en français :
- STT : Deepgram Nova-2 (multilingue, robuste)
- LLM : GPT-4o-mini en streaming (équilibre coût/latence)
- TTS : ElevenLabs Flash v2.5 (voix françaises naturelles, latence sub-300 ms)
- Télécom : Twilio EU si le numéro est belge
Hors de cette combinaison, on observe vite des dégradations qui rendent l'agent inutilisable en production.
Qualité de voix en français
C'est le critère que peu de comparatifs traitent honnêtement. Une voix anglaise robotisée est tolérable, une voix française robotisée fait raccrocher dans les 10 premières secondes.
Le constat sectoriel
Selon le comparatif Ikki publié en juin 2026, pour le français, l'espagnol et l'arabe, les voix ElevenLabs sont nettement plus naturelles que les voix par défaut de Vapi et Retell. Ce n'est pas une surprise : ElevenLabs est resté en 2026 le leader incontesté de la TTS multilingue, avec des voix françaises qui passent le test de l'interlocuteur naïf (la personne ne se rend pas compte tout de suite qu'elle parle à un agent).
Avantage Vapi
Vapi supporte ElevenLabs nativement dans son pipeline TTS. Vous brachez votre clé API ElevenLabs dans la config de l'agent, et la voix française devient un voisinage acceptable du voicebot premium. C'est un avantage concret pour les PME wallonnes francophones.
Le cas Retell
Retell utilise son propre voice engine intégré, qui supporte le français mais avec une qualité que les benchmarks 2026 classent en dessous d'ElevenLabs. Pour beaucoup de cas d'usage (qualification de leads, prise de rendez-vous standardisée), c'est largement suffisant. Pour les cas où la voix est un élément de marque (haut de gamme, image), c'est insuffisant.
Notre test sur le cas châssis
Pour l'installateur de châssis Brabant wallon, la voix française naturelle a été un critère décisif. On a démarré sur une stack TTS standard, taux de raccrochage élevé dans les 10 premières secondes. Passage à ElevenLabs via Vapi, taux de raccrochage divisé. C'est exactement le différentiel qui change le ROI de l'agent.
Pour un agent vocal en français destiné à des prospects belges, ElevenLabs reste en 2026 la référence de qualité de voix. Vapi le supporte nativement, Retell s'appuie sur sa stack interne. Si la voix est un facteur de décision (haut de gamme, premier contact), Vapi prend l'avantage.
Intégrations et écosystème
C'est là où Retell a fait un choix produit clair : être prêt-à-l'emploi avec les outils que les PME utilisent vraiment.
Retell en sortie de boîte
La page d'intégrations Retell liste un branchement direct sur Twilio (téléphonie), HubSpot et Salesforce (CRM), Make et n8n (orchestration de workflows), GoHighLevel (agence marketing). Pour un agent vocal qui doit créer un lead dans HubSpot et envoyer un SMS de confirmation, c'est de la config visuelle, pas du code.
Vapi par function calling
Vapi expose son écosystème via function calling : vous définissez les fonctions que l'agent peut appeler pendant la conversation, et chaque fonction est un appel HTTP vers le système cible. La doc Vapi recense plus de 40 outils branchables (HubSpot, Notion, OpenAI, Zapier, etc.).
C'est plus flexible mais ça demande plus de travail. Pour un cas standard PME (créer un lead, planifier un rendez-vous), c'est plus long à câbler chez Vapi qu'à activer chez Retell.
Quand le sur-mesure devient nécessaire
Pour les workflows qui sortent du standard (logique métier complexe, transferts conditionnels vers plusieurs agents humains, intégrations avec un ERP propriétaire), Vapi reprend l'avantage parce qu'il offre plus de leviers. On en parle dans notre comparatif n8n vs Zapier qui traite la même tension orchestration.
RGPD : la conversation honnête
Les deux plateformes sont américaines, point. Vapi et Retell ont leurs sièges aux États-Unis, leur infrastructure cloud principale aux États-Unis, et les données vocales transitent par les USA par défaut. Selon l'analyse sectorielle publiée sur Poskai, elles tombent ainsi sous le CLOUD Act américain, qui permet aux autorités US de demander l'accès aux données stockées par une entreprise américaine, indépendamment de la localisation physique.
Ce que ça veut dire pratiquement
Pour une PME wallonne :
- L'enregistrement vocal de l'appel (qui contient identité, voix, contenu) part par les USA, même si l'appelant est en Belgique.
- Le RGPD impose une base légale (intérêt légitime ou consentement explicite) et un encadrement par DPA (Data Processing Agreement) pour cette sortie de l'UE.
- Vapi et Retell fournissent un DPA aligné RGPD, basé sur les clauses contractuelles types post-Schrems II et le Data Privacy Framework adopté en juillet 2023.
Selon l'analyse Voice AI Guide 2026, les deux plateformes sont classées « EU-aware infrastructure » plutôt que « EU-native managed services ». La nuance est importante : aucune des deux ne propose une résidence stricte UE par défaut.
Quand ça devient bloquant
Pour la plupart des PME wallonnes (artisans, commerces, services B2B classiques), le risque résiduel est gérable avec un DPA et une mention claire dans la politique de confidentialité. Pour les PME qui traitent des données sensibles au sens du RGPD (santé, juridique, secret professionnel), c'est plus délicat.
Dans ces cas, on regarde des alternatives EU-native (Famulor en Allemagne, ou des solutions auto-hébergées sur infrastructure belge). Ce sont des conversations qu'on a régulièrement avec nos clients cabinets juridiques et comptables. Le texte officiel du RGPD est disponible sur EUR-Lex pour les chapitres 5 et 6 sur les transferts hors UE.
Vapi et Retell sont des plateformes américaines, données transitant par les USA. Les deux fournissent un DPA, ni l'une ni l'autre une résidence stricte UE par défaut. Pour la majorité des PME, c'est gérable. Pour les secteurs réglementés, il faut regarder ailleurs.
Forces et faiblesses : Vapi
Forces
- Stack modulaire qui permet de choisir le meilleur composant à chaque étage (Deepgram pour STT, ElevenLabs pour TTS française, GPT-4o-mini pour LLM rapide).
- ElevenLabs natif : qualité de voix française premium accessible facilement.
- Flow Studio visuel pour les conversations simples, code pour les complexes.
- Communauté technique active : exemples GitHub, threads Discord, recettes prêtes à copier.
- Marketplace de fonctions étoffée (40+ outils).
Faiblesses
- Facture imprévisible sans calculer la stack complète au démarrage.
- Latence par défaut moyenne, exige du tuning pour atteindre l'état de l'art.
- Plus de fournisseurs à gérer côté contrats, support, conformité.
- Courbe d'apprentissage plus raide pour une équipe sans développeur.
Forces et faiblesses : Retell
Forces
- Prix simple à lire : 0,07 $/minute voice engine inclus, pas de calcul stack au démarrage.
- Latence out-of-the-box parmi les meilleures du marché (600-800 ms médiane).
- Intégrations CRM directes (HubSpot, Salesforce) pré-câblées.
- Documentation orientée produit : prête à l'emploi, moins technique que Vapi.
- Gestion du barge-in native, conversations plus fluides.
Faiblesses
- Voice engine interne moins flexible qu'ElevenLabs pour les voix françaises premium.
- Moins de leviers de tuning : ce qui simplifie aussi limite les optimisations possibles.
- Communauté plus petite, moins d'exemples sur des cas atypiques.
- Roadmap plus opaque que celle de Vapi (moins de releases publiques détaillées).
Quel profil pour qui
Choisissez Vapi si
- Vous avez un développeur ou un partenaire d'intégration capable de tuner la stack.
- La voix française premium est un critère commercial (haut de gamme, image de marque).
- Vous avez besoin de workflows métiers complexes avec branchements conditionnels.
- Vous voulez garder la main sur les fournisseurs (changement de LLM, de TTS à tout moment).
- Vous tolérez une courbe d'apprentissage plus raide pour gagner en flexibilité.
Si ce profil est le vôtre, vous pouvez tester Vapi directement. Lien affilié : ATTA touche une commission si vous souscrivez via ce lien, sans surcoût pour vous, et ça ne change rien à notre analyse ci-dessus.
Choisissez Retell si
- Vous voulez un agent vocal en production dans la semaine, pas dans le mois.
- Votre cas d'usage tient dans le standard (qualification de leads, prise de rendez-vous, support de niveau 1).
- Vous utilisez HubSpot ou Salesforce et voulez l'intégration directe.
- Vous préférez une facture simple à anticiper.
- Vous démarrez sans développeur dédié au projet.
Alternative : prendre le temps de bien choisir
Vapi et Retell ne sont pas vos seules options en 2026. Bland AI, ElevenLabs Conversational AI, Voiceflow, Synthflow, Famulor (EU-hosted), LiveKit montent. Et pour les PME qui ont des contraintes RGPD fortes, l'auto-hébergement d'une stack open source (Whisper STT + LLaMA + voix locale) reste pertinent.
Ce qu'on fait en audit Quick Wins chez ATTA, c'est regarder votre cas réel (volume d'appels, criticité RGPD, qualité de voix attendue, intégrations CRM en place) et chiffrer les 2-3 options qui correspondent. En 30 minutes, vous repartez avec un plan d'action et une estimation chiffrée, sans avoir signé d'abonnement à l'aveugle. C'est exactement ce qu'on a fait pour l'installateur de châssis avant de retenir la stack qui tourne aujourd'hui en production.
FAQ
Q: Vapi ou Retell pour un artisan qui reçoit 20-50 appels par semaine ?
Retell, dans 8 cas sur 10. Le volume est trop faible pour justifier la complexité Vapi, le besoin se limite à la prise de rendez-vous et la qualification, et le branchement Twilio + HubSpot suffit. La voix Retell française est correcte pour un artisan local. Vapi devient intéressant si vous voulez une voix premium parce que vous vendez du haut de gamme.
Q: La latence est-elle vraiment perceptible pour un client au téléphone ?
Oui, dès 800 ms. À 1 seconde, le client sent que ça lague. À 1,5 seconde, il commence à parler en même temps que l'agent ou raccroche. Les benchmarks médians sont rassurants, mais ce sont les pics P95 sous charge qui font perdre des clients. Si vous démarrez sur un volume faible (moins de 5 appels simultanés), les deux plateformes tiennent.
Q: Le RGPD interdit-il d'utiliser Vapi ou Retell en Belgique ?
Non, mais il encadre. Vous devez signer un DPA avec la plateforme, mentionner le transfert vers les USA dans votre politique de confidentialité, et avoir une base légale (consentement ou intérêt légitime). Pour les données sensibles au sens du RGPD (santé, juridique avec secret professionnel), il faut regarder des alternatives EU-native.
Q: Combien de temps pour passer en production sur un cas standard ?
Pour Retell, 1 à 2 semaines incluant scripts, intégration CRM, tests sur 20-30 appels. Pour Vapi, plutôt 3 à 4 semaines parce que le tuning de la stack et le calage des fournisseurs prennent du temps. C'est ce qu'on observe en mission, pas un chiffre marketing.
Q: Peut-on changer de plateforme après quelques mois ?
Le coût de bascule est non négligeable. Les scripts d'agent et les flows ne sont pas portables d'une plateforme à l'autre, il faut tout réécrire. L'intégration CRM doit être recâblée. Comptez 2 à 3 semaines de travail pour un cas standard. La leçon : faites un POC sur 30-50 appels réels avant de signer l'engagement annuel sur l'une ou l'autre.
Pour conclure
Vapi et Retell sont les deux meilleures plateformes d'agent vocal pour PME en juin 2026, dans deux logiques opposées. Retell vend la simplicité d'installation et un produit prêt-à-l'emploi qui satisfait 80 % des cas PME. Vapi vend la flexibilité et le sur-mesure, au prix d'une mise en place plus exigeante. Aucune des deux n'est EU-native, mais les deux fournissent ce qu'il faut pour rester conforme RGPD sur les cas standard.
Pour un artisan ou une PME wallonne qui démarre, Retell est la voie pragmatique : un agent en production en deux semaines, un budget mensuel sous les 200 € pour un volume modéré, une facture simple à anticiper. Pour les cas où la voix française premium ou la flexibilité métier comptent plus, Vapi reprend l'avantage à condition d'avoir un partenaire d'intégration qui sache tuner la stack.
Le vrai mauvais choix, ce n'est pas l'un ou l'autre. C'est de choisir sans tester sur 30 à 50 appels réels avant de signer. Si vous voulez qu'on regarde votre cas concret (volume, criticité, attentes voix), réservez un audit Quick Wins gratuit et vous repartirez avec une recommandation chiffrée et un plan d'action, sans engagement.
Voir aussi : notre service Agents IA conversationnels pour le détail des offres voicebot, chatbot WhatsApp et assistant vocal, avec fourchettes de prix transparentes.