Transcripción de audio con ElevenLabs Scribe v2 (TypeScript)
Antes de escribir cualquier código, invoca la habilidad /speech-to-text para aprender los patrones correctos del SDK de ElevenLabs.
En esta lección, construirás un script de Python simple pero funcional que utiliza el modelo Scribe v2 de ElevenLabs para transcribir audio. La transcripción de audio es una herramienta poderosa para muchas aplicaciones, como la creación de subtítulos, el análisis de contenido de voz, la indexación de grabaciones y la mejora de la accesibilidad. Aprenderás a configurar tu entorno, cargar archivos de audio y procesar la salida, todo mientras manejas posibles errores de manera elegante.
index.ts
Crea un script mínimo que transcriba audio con ElevenLabs Scribe v2.
Para comenzar, necesitarás configurar tu entorno de desarrollo. Asegúrate de tener Python instalado y de haber configurado tu clave de API de ElevenLabs. Esta clave es esencial para autenticar tus solicitudes al servicio de ElevenLabs.
- Carga las variables de entorno desde
.env. - Lee el primer argumento de la línea de comandos como una ruta de archivo de audio opcional; por defecto, usa
./audio.mp3. - Usa
ElevenLabsClienty llama a Speech-to-Text conmodelId: "scribe_v2". - Imprime el texto transcrito en la salida estándar.
- Maneja los errores con un mensaje legible.
Este paso es crucial para mantener tu clave de API segura y fuera de tu código fuente. El archivo .env contendrá tu clave de API de ElevenLabs, que el script cargará automáticamente.
Tu script será flexible, permitiéndote especificar un archivo de audio para transcribir directamente desde la línea de comandos. Si no se proporciona ningún archivo, utilizará un archivo de audio predeterminado para facilitar las pruebas.
Aquí es donde ocurre la magia. Utilizarás la función transcribe del SDK de ElevenLabs, pasándole el archivo de audio. El modelo Scribe v2 procesará el audio y devolverá el texto transcrito.
Una vez que la transcripción esté completa, el script mostrará el texto resultante en tu terminal, permitiéndote ver el resultado de la transcripción.
Es importante que tu script sea robusto. Implementarás un manejo de errores básico para capturar problemas comunes, como la falta de la clave de API o problemas con el archivo de audio, y proporcionarás mensajes claros al usuario.
Requisitos
- Python 3.8 o superior.
- Una clave de API de ElevenLabs. Puedes obtenerla registrándote en el sitio web de ElevenLabs.
- Instala el SDK de ElevenLabs:
pip install elevenlabs. - Crea un archivo
.enven el mismo directorio que tu script con el siguiente contenido:ELEVENLABS_API_KEY="TU_CLAVE_DE_API_AQUI".
Ejemplo de uso
Para ejecutar el script con un archivo de audio específico:
python tu_script.py mi_audio.wav
Para ejecutar el script con el archivo de audio predeterminado:
python tu_script.py
Resumen
- Aprendiste a configurar tu entorno para usar el SDK de ElevenLabs.
- Creaste un script de Python para transcribir audio con ElevenLabs Scribe v2.
- Implementaste la carga de variables de entorno para la seguridad de la clave de API.
- Manejaste argumentos de línea de comandos para flexibilidad en la selección de archivos de audio.
- Añadiste manejo de errores para hacer tu script más robusto y fácil de usar.