YouTube transcript API : sous-titres ou transcription audio ?
Une API de transcript YouTube doit faire deux choses : récupérer les sous-titres quand ils existent, et transcrire l’audio quand ils manquent. Confondre ces deux cas produit des pipelines fragiles.
Quand un développeur cherche une API de transcript YouTube, il peut vouloir deux choses différentes :
- récupérer les sous-titres déjà attachés à la vidéo ;
- créer une transcription depuis l’audio parce que les sous-titres sont absents ou inutilisables.
La différence change le coût, la vitesse et la fiabilité.
Si les sous-titres existent, il est inutile de relancer de la reconnaissance vocale. S’ils n’existent pas, une API limitée aux captions renvoie une liste vide et oblige votre application à gérer un second workflow.
Techtuel gère les deux chemins derrière une seule API de transcription YouTube.
Sous-titres d’abord
Une vidéo YouTube peut contenir des sous-titres créés par l’auteur, des sous-titres traduits ou des sous-titres automatiques.
Quand une transcription exploitable existe déjà, le chemin le plus rapide et le moins cher consiste à la récupérer puis à la normaliser :
URL YouTube
↓
Recherche des sous-titres
↓
Segments de transcription normalisés
↓
JSON, SRT ou VTTCela évite de consommer des minutes de reconnaissance vocale pour un texte qui existe déjà.
Dans Techtuel, une vidéo YouTube sous-titrée est facturée comme une vidéo, quelle que soit sa durée. C’est l’écart important pour les catalogues : une conférence de 90 minutes déjà sous-titrée n’est pas facturée comme 90 minutes d’inférence.
Transcription audio quand les sous-titres manquent
Toutes les vidéos n’ont pas de sous-titres. Certaines ont des captions désactivées, incomplètes, absentes dans la bonne langue ou impossibles à récupérer.
Dans ce cas, le pipeline change :
URL YouTube
↓
Extraction audio
↓
Reconnaissance vocale
↓
Transcription horodatéeC’est plus lent et facturé à la durée audio, mais votre application obtient un transcript là où une API limitée aux sous-titres échouerait.
La vraie question produit : est-ce à votre code de gérer ce fallback ?
Avec Techtuel, non. Vous envoyez la même requête et consommez la même structure de réponse.
Une seule requête
curl -X POST https://api.techtuel.com/v1/transcriptions \
-H "Authorization: Bearer $TECHTUEL_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"source_url": "https://www.youtube.com/watch?v=VIDEO_ID"
}'Pour les traitements en lot, POST /v1/transcriptions renvoie un identifiant de job :
{
"id": "job_abc123",
"status": "processing",
"source_kind": "url"
}Puis vous récupérez la transcription :
curl "https://api.techtuel.com/v1/transcriptions/job_abc123?format=json" \
-H "Authorization: Bearer $TECHTUEL_API_KEY"La réponse finale garde la même forme, que le texte vienne des sous-titres ou de la reconnaissance vocale :
{
"id": "job_abc123",
"status": "completed",
"title": "Démonstration produit",
"language": "fr",
"minutes": 18.4,
"transcript": "Bienvenue dans cette démonstration...",
"segments": [
{ "start_seconds": 0, "text": "Bienvenue dans cette démonstration" },
{ "start_seconds": 4.2, "text": "Aujourd’hui nous présentons la nouvelle API" }
]
}Quelle sortie utiliser ?
Utilisez JSON si vous construisez un produit :
- recherche ;
- RAG ;
- extraction de citations ;
- chapitrage ;
- archive vidéo ;
- analyse.
Utilisez SRT ou VTT si votre besoin immédiat est le sous-titrage :
curl "https://api.techtuel.com/v1/transcriptions/job_abc123?format=vtt" \
-H "Authorization: Bearer $TECHTUEL_API_KEY"Utilisez le texte brut si la transcription sert seulement d’entrée à un résumé ou à un workflow éditorial.
Comparaison pratique
| Cas | Meilleur chemin | Pourquoi |
|---|---|---|
| La vidéo a de bons sous-titres | Récupérer les captions | Plus rapide et moins cher |
| La vidéo n’a pas de sous-titres | Transcrire l’audio | C’est le seul moyen d’obtenir du texte |
| Les sous-titres automatiques sont mauvais | Transcrire l’audio | La qualité peut justifier les minutes |
| Gros catalogue déjà sous-titré | Captions + cache | Évite le coût à la minute |
| RAG ou recherche | Segments JSON | Garde les citations horodatées |
| Export de sous-titres | SRT ou VTT | Directement lisible par les players |
Éviter deux pipelines
Le coût caché d’une API de transcript YouTube n’est pas toujours le modèle. C’est le code de liaison :
- récupération des captions ;
- fallback audio ;
- erreurs de source ;
- reprises ;
- stockage temporaire ;
- normalisation de sortie ;
- doublons ;
- génération de sous-titres.
Techtuel place cette couche média derrière un seul appel API.
Pour les transcripts YouTube à l’échelle, commencez par l’API de transcription YouTube. Pour un workflow média plus large, utilisez l’API de transcription générale.