Tous les articles
7 min de lecture

YouTube transcript API : sous-titres ou transcription audio ?

Une API de transcript YouTube doit faire deux choses : récupérer les sous-titres quand ils existent, et transcrire l’audio quand ils manquent. Confondre ces deux cas produit des pipelines fragiles.

Quand un développeur cherche une API de transcript YouTube, il peut vouloir deux choses différentes :

  • récupérer les sous-titres déjà attachés à la vidéo ;
  • créer une transcription depuis l’audio parce que les sous-titres sont absents ou inutilisables.

La différence change le coût, la vitesse et la fiabilité.

Si les sous-titres existent, il est inutile de relancer de la reconnaissance vocale. S’ils n’existent pas, une API limitée aux captions renvoie une liste vide et oblige votre application à gérer un second workflow.

Techtuel gère les deux chemins derrière une seule API de transcription YouTube.

Sous-titres d’abord

Une vidéo YouTube peut contenir des sous-titres créés par l’auteur, des sous-titres traduits ou des sous-titres automatiques.

Quand une transcription exploitable existe déjà, le chemin le plus rapide et le moins cher consiste à la récupérer puis à la normaliser :

URL YouTube

Recherche des sous-titres

Segments de transcription normalisés

JSON, SRT ou VTT

Cela évite de consommer des minutes de reconnaissance vocale pour un texte qui existe déjà.

Dans Techtuel, une vidéo YouTube sous-titrée est facturée comme une vidéo, quelle que soit sa durée. C’est l’écart important pour les catalogues : une conférence de 90 minutes déjà sous-titrée n’est pas facturée comme 90 minutes d’inférence.

Transcription audio quand les sous-titres manquent

Toutes les vidéos n’ont pas de sous-titres. Certaines ont des captions désactivées, incomplètes, absentes dans la bonne langue ou impossibles à récupérer.

Dans ce cas, le pipeline change :

URL YouTube

Extraction audio

Reconnaissance vocale

Transcription horodatée

C’est plus lent et facturé à la durée audio, mais votre application obtient un transcript là où une API limitée aux sous-titres échouerait.

La vraie question produit : est-ce à votre code de gérer ce fallback ?

Avec Techtuel, non. Vous envoyez la même requête et consommez la même structure de réponse.

Une seule requête

curl -X POST https://api.techtuel.com/v1/transcriptions \
  -H "Authorization: Bearer $TECHTUEL_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "source_url": "https://www.youtube.com/watch?v=VIDEO_ID"
  }'

Pour les traitements en lot, POST /v1/transcriptions renvoie un identifiant de job :

{
  "id": "job_abc123",
  "status": "processing",
  "source_kind": "url"
}

Puis vous récupérez la transcription :

curl "https://api.techtuel.com/v1/transcriptions/job_abc123?format=json" \
  -H "Authorization: Bearer $TECHTUEL_API_KEY"

La réponse finale garde la même forme, que le texte vienne des sous-titres ou de la reconnaissance vocale :

{
  "id": "job_abc123",
  "status": "completed",
  "title": "Démonstration produit",
  "language": "fr",
  "minutes": 18.4,
  "transcript": "Bienvenue dans cette démonstration...",
  "segments": [
    { "start_seconds": 0, "text": "Bienvenue dans cette démonstration" },
    { "start_seconds": 4.2, "text": "Aujourd’hui nous présentons la nouvelle API" }
  ]
}

Quelle sortie utiliser ?

Utilisez JSON si vous construisez un produit :

  • recherche ;
  • RAG ;
  • extraction de citations ;
  • chapitrage ;
  • archive vidéo ;
  • analyse.

Utilisez SRT ou VTT si votre besoin immédiat est le sous-titrage :

curl "https://api.techtuel.com/v1/transcriptions/job_abc123?format=vtt" \
  -H "Authorization: Bearer $TECHTUEL_API_KEY"

Utilisez le texte brut si la transcription sert seulement d’entrée à un résumé ou à un workflow éditorial.

Comparaison pratique

CasMeilleur cheminPourquoi
La vidéo a de bons sous-titresRécupérer les captionsPlus rapide et moins cher
La vidéo n’a pas de sous-titresTranscrire l’audioC’est le seul moyen d’obtenir du texte
Les sous-titres automatiques sont mauvaisTranscrire l’audioLa qualité peut justifier les minutes
Gros catalogue déjà sous-titréCaptions + cacheÉvite le coût à la minute
RAG ou rechercheSegments JSONGarde les citations horodatées
Export de sous-titresSRT ou VTTDirectement lisible par les players

Éviter deux pipelines

Le coût caché d’une API de transcript YouTube n’est pas toujours le modèle. C’est le code de liaison :

  • récupération des captions ;
  • fallback audio ;
  • erreurs de source ;
  • reprises ;
  • stockage temporaire ;
  • normalisation de sortie ;
  • doublons ;
  • génération de sous-titres.

Techtuel place cette couche média derrière un seul appel API.

Pour les transcripts YouTube à l’échelle, commencez par l’API de transcription YouTube. Pour un workflow média plus large, utilisez l’API de transcription générale.

Lire la documentation de l’API

Essayer Techtuel sans carte