Universo Punzadas — matriz de temas por episodio
118 episodios catalogados
1.160 autoras y autores citados
5.874 menciones extraídas

Universo Punzadas

Punzadas Sonoras es mi podcast favorito: me fascina cómo Inés y Paula eligen los temas y cómo los abordan. Siempre quise una biblioteca con las obras, autoras y referencias de sus más de 100 episodios, así que la he construido.

Datos Astro Python Buscador Visualización de datos

La pregunta

Las descripciones oficiales de los episodios solo cuentan una fracción de lo que realmente se cita. ¿Y si se pudiera buscar cualquier autora, obra o tema mencionado en el podcast, con la cita exacta y el minuto en el que se dijo?

Universo Punzadas nació de esa pregunta. Cataloga cada referencia cultural citada en los 118 episodios del podcast: libros, películas, discos, autoras, autores y los temas que las conectan.

Cómo funciona

Cada episodio se transcribe y se lee entero, palabra por palabra. Solo entra en el catálogo lo que se puede señalar con una cita literal en el audio — nada se completa por conocimiento externo.

Las transcripciones se generan con mlx-whisper (modelo large-v3) y diarización con pyannote 3.1, corriendo en local. La extracción de referencias — qué se cita, quién lo cita y en qué episodio — se hace a mano, leyendo la transcripción completa con un criterio editorial documentado.

Explora el catálogo

Búscalo directamente aquí: por autora, obra, tema o episodio, con gráficos que conectan las referencias entre sí.

Si no carga arriba, puedes abrirlo en una nueva pestaña.

Por qué este proyecto es importante para mí

Universo Punzadas junta dos cosas que me encantan: escuchar el podcast y construir herramientas de datos. Es un proyecto que exige paciencia — horas de audio escuchadas y transcritas — y cuidado editorial: cada dato tiene que poder señalarse con una cita literal.

Para mí representa lo que más me gusta de trabajar con datos: convertir algo disperso y difícil de encontrar en algo navegable, buscable y compartido.

Stack tecnológico

Transcripción
mlx-whisper (large-v3) + pyannote 3.1
Extracción
Criterio editorial manual, cita a cita
Frontend
Astro + React
Gráficos
Observable Plot + sigma.js
Datos
JSON generado con scripts Python
Infraestructura
Docker + Hetzner VPS
Código fuente
Open Source (MIT)

De la voz al catálogo

Cada episodio nuevo recorre el mismo proceso, de principio a fin:

1
Transcripción
Audio → texto con hablante identificado
2
Extracción
Lectura completa, cita a cita
3
Datos
Reconciliación y QA, JSON para la web
4
Web
Buscador y gráficos publicados

Explora el código

Universo Punzadas es open source. Explora el código o visita el catálogo completo.