Caso de estudio · IA aplicada · On-premise GPU

Pipeline end-to-end de IA para análisis de audio

Desarrollo y mantengo un sistema de inteligencia artificial para analizar grandes volúmenes de llamadas reales de forma automatizada, rápida y segura: transcripción con Whisper, análisis con LLMs locales, evaluación, persistencia y APIs.

250k+audios evaluados automáticamente
306/hAudios x hora en pico registrado
End-to-endpipeline completo en producción
On-premise2× NVIDIA RTX PRO 6000 Blackwell
Escala y velocidad

Análisis automático de llamadas a gran volumen

El sistema está diseñado para convertir audios reales en resultados estructurados que pueden ser utilizados por herramientas internas y otros sistemas de negocio. Procesa llamadas de principio a fin: ingesta, preparación, transcripción, enrutamiento, evaluación y exposición de resultados mediante APIs.

En operación ha superado los 250.000 audios evaluados automáticamente y está preparado para trabajar con lotes grandes de llamadas manteniendo trazabilidad, control de estados y tiempos de proceso optimizados.

Velocidad operativa

Muchas llamadas, procesadas rápido

La arquitectura se ha optimizado para aumentar el número de llamadas procesadas por hora y reducir esperas en el recorrido completo. El sistema ha alcanzado picos registrados de 306 audios por hora dentro del pipeline real de producción.

Las cifras se presentan de forma agregada y anonimizadas. No se publican audios, transcripciones, clientes ni detalles sensibles del entorno.

Arquitectura

Pipeline completo de producción

01

Ingesta y validación

Recepción, validación y preparación de cada audio antes de introducirlo en el pipeline.

02

Normalización y trazabilidad

Control de formato, disponibilidad, estado y trazabilidad de cada elemento durante todo el recorrido.

03

Transcripción con Whisper

Transcripción sobre GPU y almacenamiento estructurado de transcripciones y metadatos reutilizables.

04

Enrutamiento con LLMs locales

Análisis de transcripciones para decidir qué lógica, criterios o evaluaciones aplicar, sirviendo modelos mediante vLLM.

05

Evaluación automatizada

Generación de respuestas estructuradas siguiendo criterios de negocio, listas para almacenamiento, consulta e integración.

06

APIs y control operativo

Persistencia en base de datos, exposición mediante FastAPI, workers independientes, reintentos, estados, errores y monitorización de tiempos.

Mi responsabilidad

Más que usar modelos

Diseño y mantengo la infraestructura para ejecutar IA de forma fiable: servicios backend en Python, integración de Whisper y LLMs locales, pipelines distribuidos, workers especializados, procesamiento asíncrono, optimización GPU, APIs con FastAPI, Docker, persistencia, trazabilidad, control de errores y análisis de cuellos de botella.

Hardware

Entorno on-premise con 2× NVIDIA RTX PRO 6000 Blackwell, orientado a mantener audios, transcripciones e información sensible dentro de la infraestructura de la organización.

Stack
PythonWhisperLLMs localesvLLMFastAPIDockerGPUAPIs RESTProcesamiento distribuidoBackend producción
Privacidad

Por confidencialidad profesional no se publican repositorios privados, audios, transcripciones, prompts internos, datos de clientes ni detalles sensibles de infraestructura. Las cifras se presentan agregadas y anonimizadas.