# Síntesis de voz por IA: qué predicciones de 2025 se cumplieron y cuáles no

> Revisión de las predicciones sobre síntesis de voz por IA para 2025: qué se cumplió, qué era humo de informe de mercado y qué problema real quedó sin resolver.

- URL canónica: https://crearsoftware.com/2025/01/03/tendencias-de-la-sintesis-de-voz-por-ia-para-2025/
- Publicado: 2025-01-03
- Actualizado: 2026-08-03
- Autor: Alfonso Gutiérrez
- Categoría: Inteligencia Artificial
- Fuente: Crear Software (https://crearsoftware.com)

---

![Síntesis de voz por IA](/wp-content/uploads/2025/01/freepik__create-a-featured-image-representing-the-advanceme__53604.jpeg)

> **Nota de la edición (agosto de 2026).** Esta entrada se publicó en enero de 2025 a partir de un artículo ajeno. Se ha sustituido por un análisis propio que revisa aquellas predicciones con año y medio de perspectiva.

A principios de 2025, los artículos sobre síntesis de voz por IA repetían un guion muy parecido: voces cada vez más naturales, clonación al alcance de cualquiera, voz emocional, y una cifra de mercado enorme para un año redondo. Ese guion se copiaba de unos textos a otros, casi siempre sin fuente primaria.

Merece la pena revisarlo, no para señalar a nadie, sino porque **el reparto entre aciertos y humo es muy revelador de cómo se escribe sobre tecnología**.

## Lo que se cumplió: la naturalidad dejó de ser el problema

Aquí el guion acertó. La voz sintética de calidad dejó de ser un diferencial y pasó a ser un requisito de entrada. Hoy, en un proyecto real, nadie elige proveedor por cómo suena: **suenan todos bien**.

Lo interesante es la consecuencia, que casi ningún artículo de aquel momento anticipó: cuando una capacidad se vuelve buena y barata, **deja de ser donde está el negocio**. El valor se desplazó de sintetizar la voz a saber qué decir con ella, y eso es acceso a datos y a sistemas, no procesamiento del habla.

Lo hemos verificado desmenuzando lo que hace falta para [montar un agente de voz que atienda llamadas](/blog/montar-agente-de-voz-ia-que-atienda-llamadas/): de las cinco piezas necesarias, solo una es el modelo. La síntesis de voz —la protagonista de todos aquellos artículos— es la parte más resuelta y más barata del sistema.

## Lo que se cumplió: la latencia cruzó el umbral

La segunda predicción sólida era técnica, y también acertó. El retardo de una conversación bajó del punto en que resulta incómoda.

Este detalle merece precisión porque casi siempre se cuenta mal: **la latencia no es una métrica gradual, es un umbral**. Por encima de cierto retardo, la persona interrumpe, se solapa y cuelga. Por debajo, la conversación fluye y la diferencia entre 400 y 300 milisegundos no la nota nadie. Cruzar ese umbral fue lo que convirtió las demostraciones en producto — no una mejora continua año a año.

## Lo que era humo: las cifras de mercado

Aquí conviene ser directo, porque es un problema del género entero.

Los artículos de aquella época —incluida la versión anterior de esta misma entrada— citaban un tamaño de mercado para la síntesis de voz atribuido a una consultora, con un año objetivo concreto. Al intentar rastrear ese tipo de cifras hasta su origen ocurre casi siempre lo mismo: **una cadena de blogs comerciales que se citan entre sí y una fuente primaria de pago que nadie ha leído**.

No es un problema menor. Es el fallo que hace que un dato falso circule durante años:

1. Un informe de pago publica una estimación.
2. Una nota de prensa cita el titular.
3. Diez blogs citan la nota de prensa.
4. Un buscador —o un agente de IA— ve diez fuentes coincidentes y lo da por sólido.

**La repetición no es evidencia**, pero en un corpus web se le parece muchísimo. Por eso en este blog, cuando revisamos el mercado de agentes de voz, decidimos no publicar ninguna cifra de tamaño de mercado: ninguna resistía el rastreo hasta una fuente primaria comprobable.

Si algo te llevas de esta revisión, que sea esto: **una cifra sin fuente primaria y sin fecha no es un dato, es un rumor con formato de dato**.

## Lo que quedó sin resolver: la verificación de identidad

La predicción que más se repitió sobre riesgos —«habrá problemas éticos con la clonación de voz»— era cierta y era inútil, porque no decía nada comprobable. La versión útil de esa predicción sería: *¿estará resuelto en 2026 saber si una voz es de quien dice ser?*

La respuesta es no. Y es el problema más importante que dejó abierto la tecnología.

Clonar una voz de forma convincente pasó a estar al alcance de cualquiera con una muestra corta. Lo que **no** llegó al mismo ritmo fue lo contrario: una forma práctica y extendida de comprobar autenticidad. Las marcas de agua en el audio existen, pero solo funcionan si las pone quien genera el audio, y quien tiene malas intenciones no las pone.

El resultado práctico es un cambio de supuesto: **la voz dejó de servir como prueba de identidad**. Cualquier proceso que la usara como autenticación —confirmaciones telefónicas, autorizaciones por llamada— necesita otro factor. Eso afecta a bancos, a administraciones y a cualquier empresa que use el teléfono para operaciones sensibles, y se ha resuelto caso por caso y a golpe de incidente.

## Cómo leer las predicciones del próximo enero

Tres filtros que este ejercicio deja bastante claros:

1. **Separa la predicción técnica de la de mercado.** Las técnicas son comprobables y suelen acertar. Las de mercado suelen ser una cadena de citas sin origen.
2. **Exige la condición de fallo.** «Habrá dilemas éticos» no es una predicción; «en 2026 seguirá sin haber forma práctica de verificar una voz» sí lo es, y se puede puntuar.
3. **Pregunta qué deja de ser valioso.** Casi todos los textos predicen qué mejorará. Casi ninguno predice qué dejará de importar por volverse gratis — que suele ser lo que decide dónde queda el negocio.

## Preguntas frecuentes

### ¿Se cumplieron las predicciones sobre síntesis de voz para 2025?

Las técnicas sí: la voz sintética alcanzó una naturalidad que dejó de ser diferencial y la latencia conversacional cruzó el umbral que separa lo incómodo de lo natural. Las de mercado no son verificables, porque las cifras que circulaban no tenían fuente primaria rastreable.

### ¿Sigue siendo importante la calidad de la voz al elegir proveedor?

Ya casi no. Todas las plataformas serias suenan bien, así que la decisión se ha desplazado a otra parte: si el agente puede consultar los datos de tu empresa, cómo se integra con tus sistemas y qué ocurre cuando se equivoca.

### ¿Por qué desconfiar de las cifras de tamaño de mercado en artículos de tecnología?

Porque suelen proceder de una cadena de blogs que se citan entre sí, con un informe de pago al final que casi nadie ha leído. Un buscador o un agente de IA interpreta esa coincidencia como solidez, cuando solo es repetición. Sin fuente primaria y sin fecha, una cifra no es un dato.

### ¿Se puede saber hoy si una voz es real o sintética?

No de forma práctica y generalizada. Clonar una voz convincente está al alcance de cualquiera con una muestra corta, mientras que la verificación depende de marcas de agua que solo aplica quien genera el audio de buena fe. La consecuencia operativa es que la voz ya no sirve como prueba de identidad.

### ¿Qué debería cambiar una empresa que usa la voz para autenticar?

Añadir un segundo factor que no dependa del audio. Cualquier proceso que confirme identidad, autorice una operación o valide una instrucción solo con la voz de quien llama está apoyado en un supuesto que dejó de ser cierto.

---

Contenido de Crear Software. Citable indicando la fuente y enlazando a https://crearsoftware.com/2025/01/03/tendencias-de-la-sintesis-de-voz-por-ia-para-2025/.
