YouTube transcripts

🚀 Fish Audio: La Alternativa a ElevenLabs (Clona tu Voz + Agentes de Llamadas + MCP con Claude): video thumbnail

🚀 Fish Audio: La Alternativa a ElevenLabs (Clona tu Voz + Agentes de Llamadas + MCP con Claude) transcript

Pablo Martínez · @pablomartinezgarcia_

Published September 20, 20261:01:481.5K views

Watch this video on YouTube

Transcript analysisComputed from the caption text

Words

11,296

Runtime

1:01:48

Speaking pace

183wpm

Reading time

47min

183 words per minute, just over the 181 median of 349 measured videos. That distribution comes from the 349-video hook study.

Opening (first 30 seconds)

¿Sabías que solo necesitas una fotografía y 10 segundos de tu voz grabada para crear un avatar digital de ti con inteligencia artificial y poder usarlo para hacer un montón de cosas? Yo no lo sabía y he aprendido a hacerlo en este vídeo. Comparte porque vas a ayudar a un montón de personas. He aprendido a usar esta plataforma que me permite clonar mi voz con inteligencia artificial, crear voces personalizadas de cualquier tipo, crear asistentes que respondan a llamadas de mis clientes o usuarios y un montón de cosas más

92 words, the words spoken in the first 30 seconds at 183 words per minute.

Sentence shape

MeasureThis transcript
Sentences865
Average words per sentence13.1
Longest sentence81 words
Questions asked67
Sentences containing a number44

Most used terms

  • que522
  • de459
  • la292
  • el231
  • en222
  • lo199
  • es190
  • para150
  • te131
  • voz124
  • con119
  • le119

Filler phrases

1 in total: like 1.

A literal whole-word count of the same phrase list the Prepublish browser extension uses, so a phrase inside another word is not counted and a phrase used in its ordinary sense still is. It is a count and not a judgement.

What this transcript is

Every word below is the caption track YouTube publishes for this video, pulled from the video itself and reproduced unchanged. It is not Prepublish's writing, not a summary, and not a re-transcription: it is the video's own published captions. Spanish captions, generated automatically by YouTube, in the video’s original language. Source: the video on YouTube. A channel that would rather this page did not exist can ask for its removal through the contact page, and it is removed.

Transcript

¿Sabías que solo necesitas una fotografía y 10 segundos de tu voz grabada para crear un avatar digital de ti con inteligencia artificial y poder usarlo para hacer un montón de cosas? Yo no lo sabía y he aprendido a hacerlo en este vídeo. Comparte porque vas a ayudar a un montón de personas. He aprendido a usar esta plataforma que me permite clonar mi voz con inteligencia artificial, crear voces personalizadas de cualquier tipo, crear asistentes que respondan a llamadas de mis clientes o usuarios y un montón de cosas más que te explico en este vídeo.

Vamos, que te lo enseño. ¿Qué es Fish Audio? Todas las herramientas que ofrece para trabajar con voz e inteligencia artificial y cómo utilizar esas herramientas. Es lo que te voy a explicar a continuación. Pero antes te recuerdo que aquí abajo en la descripción tienes el índice de contenidos para que vayas a la parte que más te interese. Por ejemplo, si solo quieres saber cómo clonar mi voz con inteligencia artificial, mira en la descripción o en el primer comentario, busca el punto en el que lo explico, haz clic y te llevará a la parte de este vídeo en el que te cuento cómo hacerlo.

Lo que estás viendo en pantalla es la web oficial de Fish Audio. Te dejo el enlace para que te registres aquí abajo en la descripción y si lo haces así te llevarás un pequeño regalo, unos créditos extra al entrar y registrarte directamente con ese enlace. Fish Audio es una plataforma que te ofrece todas las herramientas necesarias para que trabajes con voz e inteligencia artificial de 0 a 100 para que puedas dar cobertura cualquier proyecto que al que vayas a enfrentarte y necesites de esta tecnología.

Desde crear voces, como puedes ver en su página principal, y no estamos registrados todavía, lo vamos a hacer en los siguientes puntos de este vídeo, desde crear voces con los matices que necesites, género, énfasis, tipo de voz, interlocutor, lo que sea, hasta clonar voces. Podemos extraer la voz de un fichero de audio. Podemos pasar de texto a audio. Podemos pasar de audio a texto. E incluso hay una opción para crear agentes que tú entrenas con tus documentos, tu base de conocimiento, para que esos agentes mediante una llamada puedan interactuar con tu equipo de trabajo, con tus empleados y, ¿por qué no?, también con tus clientes.

Todo esto es lo que vamos a ver a lo largo de este vídeo. Tienes todo el índice aquí abajo. Ahora vamos a ver cómo registrarnos en esta plataforma porque es el primer paso para comenzar a usarla. Cómo registrarte en Fish Audio para usar la plataforma gratis es lo que te voy a enseñar a continuación. Para hacerlo, haz clic en el enlace que te dejo aquí abajo en la descripción o en el primer comentario y llegarás a esta página web.

Si por algún motivo no está en el idioma que quieres, puedes cambiarlo haciendo uso de los iconos que ves aquí arriba. Antes de cambiar el idioma, te voy a enseñar a cómo cambiar el modo de la web. En claro que es por defecto u oscuro, haciendo clic aquí. ¿Ves? Lo podemos cambiar de esta forma tan sencilla. Yo a partir de ahora lo dejo en oscuro porque es más saludable y nos quema menos la vista. A continuación tenemos el icono del idioma.

Hacemos clic y tenemos los idiomas de la interfaz. Si lo quiero en inglés, lo pongo en inglés. Hago clic y me lo cambia todo. Si lo quiero en español, hago clic y me lo pone todo en español. Perfecto. Vamos a registrarnos. Eh, para hacerlo tenemos que hacer clic en el enlace de en el botón de aquí arriba, iniciar sesión o registrarse. Al hacer clic nos va a aparecer esta pantalla en la que nos pide o una cuenta de Gmail o un correo electrónico.

Voy a poner en pausa ahora el vídeo para registrarme. Es un proceso sencillo. Pon tus datos, te registras y ya está. Y entramos a la plataforma. Solo tienes que aceptar los términos y condiciones y directamente entras en esta plataforma, en la plataforma de Fish Studio en el entorno de trabajo. Sabemos que estos estamos en el entorno de trabajo porque ya tenemos aquí nuestra cuenta con el usuario y al hacer clic podemos ver nuestro perfil, cambiar el nombre, poner una foto, lo que queramos.

Importante, en el momento de grabar este vídeo, cuando te registras te cargan unos créditos para que puedas usar la aplicación gratis, en este caso 8,000. Quizás cuando veas este vídeo te den más créditos o quizás te den menos, va a depender de en qué momento lo veas. De esta forma nos registramos gratis en esta aplicación y os tenemos créditos para comenzar a usarla gratis, que es lo que vamos a ver a lo largo de este vídeo.

Antes de comenzar a explicarte las herramientas de esta plataforma, quiero hacer una mención especial al asistente de ayuda porque está muy bien. Lo tienes abajo a la derecha. Para usarlo, haz clic aquí en preguntar, se te abre el asistente que está hecho con su propia tecnología Fish Agent. Luego veremos cómo crear agentes, no como este, sino de voz para responder llamadas, que es algo también espectacular. Y tienes aquí abajo en el índice de contenidos.

Y ahora vamos a preguntarle, por ejemplo, ¿cómo se cambia el idioma de la interfaz a español? Le doy a enviar. Lo que está haciendo es pensar la respuesta y ahora me la va a dar, pero de una forma especial. Fíjate como hay una animación y se ha ido directamente al icono de la interfaz. Me lo indica de forma visual. La verdad es que es una forma muy original, ojo, útil y rápida, eficaz de dar ayuda al usuario que esté utilizando la aplicación.

Ahora ya sí, continuamos con todas las herramientas que tiene Fish Audio. Es importante que sepas que el momento de grabar este vídeo, Fish Audio nos ofrece tres modos de uso a los que puedes acceder haciendo clic en el desplegable que se encuentra en la parte superior izquierda. Los modos son creativo, desarrollador y agentes. Quizás te falte algún modo de uso y eso seguramente es debido al tipo de cuenta que tienes.

Te voy a enseñar luego cómo poder hacer un upgrade de tu cuenta para poder desbloquear algún modo de uso si es que lo necesitaras. El modo de uso por defecto es el creativo, es el primero que aparece seleccionado y es el que el usuario habitual, como tú, tú y quizás yo también, aunque también soy programador, vamos a usar para desarrollar nuestros proyectos y usar todas las herramientas que nos ofrece Fish Audio. También tiene el modo desarrollador.

Esto está pensado para personas que desarrollan proyectos y necesitan tecnología de procesamiento, modificación o creación de voz con inteligencia artificial. Fish Audio permite que te conectes o conectar tus proyectos con su API, su conjunto de funciones, para que utilices toda su tecnología mediantes llamadas directamente por programación. Esto tiene un coste distinto y otras condiciones que son distintas a las habituales.

Todo esto que veis aquí es el playground, el entorno de trabajo y de pruebas para los desarrolladores. Y luego tiene el modo agentes. Este tengo que decirte que me ha encantado usarlo. Te permite crear agentes con la base de conocimiento que tú quieras. Le puedes dar los ficheros que necesites de tu empresa o de tu proyecto y te crea un agente de inteligencia artificial con la voz que tú quieras para responder llamadas, bien dentro de tu empresa, para ayudar a tu equipo o responder preguntas a tus empleados o quizás para ofrecerlo como asistente de inteligencia artificial de atención a clientes.

Yo me he creado uno que se llama Elías. Luego al final de este vídeo te voy a enseñar este ejemplo con el pron, la voz, cómo lo he hecho y con una o varias llamadas de prueba que le vamos a hacer. De esta forma podemos cambiar entre un modo de uso y otro en fish audio. ¿Cómo está estructurada la interfaz de fish audio? Es lo que te voy a explicar a continuación. Puedes ver que está dividida en dos grandes partes. La parte de la izquierda en la que vemos las herramientas y funciones del modo de uso que hayamos seleccionado, en nuestro caso creativo.

Y aquí vemos todas las herramientas del modo eh creativo. Y luego tenemos la parte central. en la parte central donde vamos a trabajar, donde vamos a poder eh definir el tipo de voz, modificarla, sincronizar con vídeo y hacer todo lo necesario. Dentro de esta parte central destacar que arriba a la derecha están esos botones del cambio de de tonalidad de la web, de idioma y también de información de nuestro perfil y el uso de los créditos que vamos haciendo.

Al hacer clip veremos todos los créditos que tenemos y los que se van gastando. Importante también abajo a la izquierda hay un botón que dice actualizar plan. Si cuando terminemos los créditos o consumamos los créditos gratuitos que obtenemos al registrarnos en Fish Audio, necesitamos o queremos seguir usando la plataforma para nuestros proyectos, es posible que necesites actualizar el plan. Al hacer clic aquí vas a ver las promociones, ofertas y los tipos de cuenta de planes que hay con las características para que decidas cuál te interesa más.

En el momento de grabar este vídeo, estas son las promociones y las características que hay. Te invito a que las veas cuando lo necesites. Ahora vamos a pasar ya a explicar las herramientas con casos de uso de cada una de ellas. ¿Cómo clonar tu voz con la inteligencia artificial? Es lo que te voy a explicar a continuación. Para ello tienes que irte al menú de la izquierda donde dice voz personalizada. Hacemos clic y vemos todo el entorno.

Yo no tengo ninguna voz, por lo que no vemos ninguna. Hay distintas opciones como algunas voces predeterminadas y en otros idiomas que te invito a que vayas revisando. Yo voy a hacer clic en voz personalizada y en construir una nueva voz. Aparece esta ventana con tres opciones. La primera, clonación de voz instantánea. Dice, "Sube o graba 10 segundos de audio y clónala al instante. Perfecto. Diseño de voz. Describe la voz en texto simple, la describe con los matices que quieras y te crea la voz.

O clon de voz profesional, voz verificada de persona real, calidad de estudio con lanzamiento comercial opcional y reparto de ingresos. Ojo, cuidado que esto ya es muy pro. Nosotros vamos a hacer el primer caso, que es el más sencillo. Si quieres más, te invito a que lo hagas. El proceso es similar al que vas a ver a continuación. Clonación de voz instantánea. Le doy a continuar y me aparece esto. Clon de voz instantáneo compatible distintos ficheros.

Puedo cargar o puedo registrar. Le voy a decir que le voy a dar a registrar. Dice, vamos a empezar. Tengo que leer esta frase. Para ello me va a pedir que eh seleccione el micrófono. Voy a seleccionar el micrófono o bien del Mac o del eh iPod que tengo eh puesto en el auricular porque este micrófono lo uso para grabar el vídeo. O sea, parece que no, pero yo tengo cierta complejidad para esto. Vamos a ver. Hay que leer esta frase y listo.

Le voy a dar a empezar. De niños jugábamos en la calle hasta que empezaba a oscurecer y la señal para volver a casa era el olor a comida que salía de las cocinas sin relojes ni mensajes y nadie llegaba tarde a cenar. Qué tiempos aquellos. Perfecto, ya lo he grabado. Espero que haya usado el micrófono adecuado. Vamos a verlo. Ahora aquí me aparece la grabación. 17 segundos. He tardado un poco más, no pasa nada. Le doy a analizar audio.

Vamos a ver. Ahora vamos a esperar a que termine el proceso de análisis. Igual tarden unos segundos. Cuando comience un proceso así, lo que voy a hacer va a ser parar el vídeo y luego te cuento el tiempo que he tardado en hacer esta acción y te enseño el resultado. Ha tardado unos 10 segundos en terminar el proceso de analizar y me dice continuar a los detalles. Le doy a continuar a los detalles y me aparece esto. Narrador cálido español Pablo Martínez García, que soy yo, evidentemente, una voz masculina de tono cálido y pausado.

Me está describiendo la voz. ¿Cómo es? Muy bien. Voice details, voice name. Narrador, cálido español. Eh, Pablo. Voz de Pablo. Voz de Pablo. Le voy a poner el nombre. Perfecto. No le voy a poner ninguna imagen. Descripción, tal cual. Género masculino, tipo público, no listado, privado. Confirmo que tengo los derechos. Pues sí, le voy a dar a cre, que imagino que será eh crear. Vamos a ver lo que hace. Y lo que tarda.

Voy a ver a parar el vídeo para no hacerte perder mucho el tiempo. Bueno, pues casi casi que le he dado a parar y ha aparecido esta pantalla. Ha sido casi instantáneo, ¿eh? Ha tardado un segundo, 2 segundos. Voz de Pablo. Esta es la descripción. He creado una voz. He clonado mi voz. La he creado con mi propia voz. Muy bien. Dice, "Utilizar esta voz." Vamos a ver esto. ¿Qué es? Le doy a utilizar. Em. Ah, y ah, va a leer este vídeo.

Recordar aquellos días de infancia cuando el tiempo parecía detenerse. Ah, va a leer, va a leer esto. Vamos a ver. Le voy a dar a play. Voy a voy a voy a confirmar primero que se escucha bien. Vale, perfecto. Vamos a ver. Recordar aquellos días de la infancia cuando el tiempo parecía detenerse y cada tarde estaba llena de aventuras. Esos momentos simples son los que realmente quedan grabados en nuestra memoria. Wow. Eh, espero que les haya escuchado bien.

He confirmado que sí. A ver, tengo que decir que em me ha parecido bastante bueno el resultado. Eh, esta es una voz clonada igual que la mía. Es igual. Ahora bien, eh, ¿es una voz hiper realista o que pasaría algún sistema de detección de voz poría? No lo sé, porque hemos usado la versión más light, la en la clonación instantánea. ¿Qué pasaría si usáramos la voz profesional? En la clonación profesional, pues yo estoy convencido que si hemos obtenido esto con 10 segundos de grabación de nuestra voz, pues imagínate si la hacemos con la opción de voz profesional.

Yo estoy convencido que el resultado sería francamente espectacular. A mí de entrada esto me ha gusta bastante. Claro, esto lo puedes utilizar para clonar tu voz, para crear voces describiendo una voz, la que tú quieras, o le puedes cargar un fichero de audio, como hemos visto en las tres opciones que nos ha ofrecido, ¿no? Bueno, eso ya te invito a que tú lo vayas probando y estoy seguro que primero vas a disfrutar mucho y te van a sorprender los resultados. ¿Cómo utilizar la biblioteca de voces profesionales que Fis audio pone a nuestra disposición?

Es lo que te voy a enseñar a continuación. En el punto anterior hemos creado una voz, hemos clonado nuestra voz. Podíamos haber creado cualquier otra, pero hemos clonado la nuestra. Perfecto. Bueno, pues ahora si nos vamos aquí en el menú de la izquierda donde pone descubrimiento, vamos a ver la biblioteca de voces profesionales hechas con inteligencia artificial que podemos utilizar y además la están clasificadas de distinta forma. si hay voces masculinas, femeninas, neutrales, eh voces de personas jóvenes de mediana edad, voces que narra eh de en forma dramática, misteriosa o en formato anime con esa voz tan peculiar de los animes.

Al hacer clic en cada una de estas opciones, pues se aplica el filtro y nos muestran las voces que cumplen esos requisitos. Yo lo voy a desactivar todos para ver las la las voces que aparecen en la pantalla en la primera página. Voy a hacer, por ejemplo, clic en esta para escucharlo, porque de esta forma, si hacemos clic encima del icono de cada voz en el play, eh, escuchamos una preview de la voz. ¿Piensas que tus decisiones son realmente tuyas?

La mayoría vive siguiendo patrones automáticos, repitiendo comportamientos sin cuestionarlos. Pero la verdadera transforma, esta voz es la voz de un locutor K, dice aquí, se llama Fernandico, eh, voz femenina español. Hago clic. Después de 30 años trabajando en la misma empresa, me entregaron una carta de despido y una pequeña caja para mis pertenencias. No está mal. Jesús narrador. En aquellos días, Jesús caminaba por Galilea enseñando a las multitudes.

La gente lo seguía asombrada, pues sus palabras traían La verdad que está muy bien. Eh eh audio de terror. ¿Sabías que Elvis Presley podría estar vivo en una isla secreta del Caribe? Algunos testigos aseguran haberlo visto en esta. La verdad es que está está muy bien. Esta voz me ha recordado y seguramente ahí también a esos vídeos cortos que cuentan historias reales, muchas de ellas de terror que tienen finales pues más o menos trágicos.

Usan voces parecidas a esta. Claro, porque tú puedes crear voces, como hemos visto en el punto anterior, o podemos utilizar cualquiera de estas voces para nuestro ámbito profesional, no solamente nuestros proyectos personales, por supuesto que sí. Podemos hacer vídeos de Product Concept o explicando servicios eh con alguna composición, algún vídeo y un narrador de fondo. O podemos hacer vídeos que sincronicen el vídeo con la narración.

Esto lo vamos a ver también a lo largo de este vídeo. Tienes lo tienes todo en el índice de contenidos aquí abajo en la descripción y en el primer comentario. También podemos usarlo en nuestros proyectos personales, nuestro día a día y por supuesto en nuestra empresa. Si eres emprendedor o emprendedora y tienes tu proyecto, lo estás lanzando, lo puedes utilizar. Muy bien. Pues de esta forma hacemos la preview. Escuchamos a ver si nos gusta la la voz.

Voy a quedar con esta de colombiana IA y le voy a decir a utilice a utilizar. Hago clic y se me abre esta pantalla. Aquí vemos el entorno de trabajo donde aparece un texto, que es el texto que queremos eh generar con esa voz. Y aquí a la derecha pues los ajustes, el ajuste por la voz. Aquí podemos modificar el modelo de IA que queremos usar. son modelos de fish audio. Yo te sugiero que dejes el modelo que te aparece por defecto, porque es el que con el que mejor resultado vas a obtener.

A no ser que hayas leído en sus manuales o en sus hojas de especificaciones técnicas algo que te resulte más interesante de otros modelos anteriores y los quieras usar. Perfecto. Los controles de volumen de de volumen y velocidad los tienes aquí y algunos más. Bueno, pues vamos a suponer que nos parece adecuado el texto. Aquí es donde tú pegas el texto que quieres y le vamos a dar eh a generar discurso. Le damos a generar discurso aquí abajo.

Ahora va a empezar a trabajar. Para ofrecer mayor calidad, generaremos El amor verdadero no se mide en palabras bonitas, sino en acciones silenciosas. Una mujer que ama de verdad construye junto a él, sueña junto a él, lucha junto a él, no busca perfección. Vale. Okay. Eh, es que se ha lanzado directamente. Dice que para ofrecer mayor calidad te va va a crear dos muestras. Vale, perfecto. Tenemos esta muestra que es la que se ha lanzado.

Busca autenticidad y en cada batalla ella es su fortaleza. Su Wow. Lo que me ha sorprendido es lo rápido que es y además cómo se ha ido generando en tiempo real. Es es rapidísimo. Eh, vamos a darle a la segunda muestra. El amor verdadero no se mide en palabras bonitas, sino en acciones silenciosas. Una mujer que ama de verdad, construye junto a él, sueña junto a Vale, la verdad es que me ha gustado más esta segunda. Bueno, pues simplemente ahora si lo quiero usar pues le doy a descargar.

Ya se me ha descargado el fichero en formato MP3, como veis aquí arriba, y desde este momento pues ya lo puedo usar en los proyectos e que yo necesite. Y es así de sencillo, le podemos poner todo el texto que queramos, agregar otro locutor, podemos hacer todo lo que queramos en esta pantalla para generar el texto, eh, el audio con los textos que queramos. cómo crear podcast, audiolibros e incluso historias audibles lo que te voy a contar a continuación.

Para ello vamos a usar una de las herramientas que nos ofrece Fish Audio y que a mí personalmente me ha gustado bastante y ahora te contaré por qué. Se llama estudio de historias. Está en la parte izquierda y es la primera la primera opción que vemos en productos. Hacemos clic en estudio de historias y vemos estas opciones. Tengo un proyecto sin título que me he creado de prueba antes para eliminarlo y así te enseño hacerlo.

Me pongo encima de los tres puntos, hago clic y le doy a eliminar proyecto. Perfecto, lo borro y luego veo estos que están aquí. Estos son proyectos de prueba que te voy a enseñar a continuación. ¿Esto para qué sirve? Sirve para crear historias, audiohistorias, historias narradas, audiolibros y también podcast, por supuesto que sí. y podcast profesionales con varios locutores. ¿Cómo se hace? Pues le damos a nuevo proyecto y tenemos dos opciones, un proyecto en blanco o importar un documento.

Si le damos a un proyecto en blanco, vamos a entrar al entorno de trabajo para comenzar de cero. Lo vamos a ver ahora. Y si le damos a importar un documento, dice que puede ser un documento Word, PDF o texto, la lo divide en capítulos y hablantes. Te lo hace todo la y te lo muestra para que lo veas, lo supervises y lo modifiques, por supuesto, y hagas los cambios que quieras. Vamos a comenzar con un proyecto en blanco, simplemente para que veas el entorno.

Hacemos clic y entramos al entorno de trabajo. Tiene dos grandes partes. La parte, bueno, son tres. La parte central donde escribimos lo que queremos que diga el personaje, la voz del personaje, que la elegimos aquí a la izquierda. Esta es la otra parte, la parte de la derecha donde están todos los controles y opciones. Elegimos el formato del texto, darle más o menos énfasis, las voces, los locutores, todo eso. Y luego aquí abajo tenemos la línea de tiempo, eh la línea eh con la grabación para ir supervisando todo lo que se va diciendo en el texto y comprobar y poder escuchar si todo está bien.

Esta es la pantalla de grabación e y de comenzar un proyecto de cero. Y esto cuando se trabaja qué aspecto tiene? Pues el siguiente. Vamos a irnos a estudio de historias y vamos a abrir uno de los proyectos, como por ejemplo este, la carta sin remitente. Le doy ahí, hago hago clic en la flecha y veo el entorno. Es igual que el anterior, simplemente que aquí ya vemos como hay varios párrafos y cada párrafo tiene un locutor. ¿Ves?

Un chico eh, que se llama élite, este otro élite, bueno, no aparece nada porque es el mismo. Y luego aquí una chica, ¿ves? Hay varios eh párrafos con distintos locutores. Aquí vemos las voces que se han seleccionado e incluso una de Jesús Narrador que se ha agregado en el proyecto y no se ha llegado a utilizar. No pasa nada. Y aquí abajo, que es lo lo importante, es en la línea de tiempo con la narración ya hecha. Vamos a darle a play para ver.

Elena encontró el sobre un martes por la tarde entre facturas y propaganda. Está muy bien. Papel amarillento. Sinc. Vale, este es el primer párrafo que está leyendo. Vamos a irnos al segundo para que luego eh para luego escuchar a la chica. Vale, cojo la línea de tiempo, me la traigo aquí simplemente para ver cómo cambiaantemente. Familiar. Qué extraño, no tiene matasellos. Entonces alguien la dejó aquí en persona. Bueno, fíjate como le pone también sentimientos.

Esto le puedes especificar sentimientos y formas de el bread ese de ja, ¿vale? Ese suspiro, ¿no? Que hace. Em. Y esta es la chica. Está, la verdad es que está muy bien. Veréis, eh, hay algo importante que que os quiero comentar. Cuando se produjo el boom de la IA allá por noviembre 2022, cuando se presentó CH GPT, tengo que decir que muchas personas empezaron a escribir libros con IA. A continuación, cuando se produjo el boom de las imágenes, esto vino con Nano Banana de la mano de Yemini, muchas personas empezaron a a crear e historias, libros con eh representaciones gráficas. libros con animaciones, con dibujos.

Perfecto. E y ahora estamos en la área, yo creo, de la voz. Hay muchas personas que están creando ya no solamente vídeos, que por supuesto los habrás visto creados con IA, en los que crean imágenes, luego crean la secuencia de vídeo y luego le ponen voz. voces como esta de aquí y de otras plataformas, por supuesto. Eh, y también eh se crean podcast podcast con voz con voces profesionales y es que se hace así con plataformas como FIS de una forma tan eh eficiente y tan realista como esta.

En definitiva, esto lo puedes utilizar para crear proyectos profesionales en tu trabajo, hacer presentaciones, por supuesto, en tus proyectos personales para publicarlo en redes y, cómo no, en tu empresa si eres emprendedor o emprendedora y necesitas utilizar eh tecnología de voz generada por para alguno de tus proyectos. de esta forma tan asombrosa. Y tengo que decir que a mí estas cosas me siguen sorprendiendo, sobre todo lo bien que funcionan, ¿no?

Porque es realmente espectacular ver como de esta forma tan sencilla y con algunos pocos clics pasas de 0 a 100 en unos pocos minutos. Bueno, continuamos con el tutorial. ¿Cómo convertir cualquier texto en una narración con la voz que más te interese? Es lo que te voy a enseñar a continuación. Para ello tenemos que irnos al menú de la izquierda, le damos de texto a voz, hacemos clic aquí y se nos abre esta pantalla, este entorno de trabajo.

Bueno, para ello eh me aparece esta interfaz. Yo he hecho ya alguna prueba, por eso me aparece voz de Pablo. En primer lugar me aparecen dos párrafos e para que escriba lo que quiera. Voy a escribir aquí este texto, uno que me he copiado antes. Soy Pablo Martínez. Eh, Pablo Martínez García, ¿no? Que que demasiado largo. Soy Hola, soy Pablo Martínez. Bueno, voy a poner hola. mejor. Hola, soy Pablo Martínez, profesional, divulgador y formador de inteligencia artificial para empresas.

Me dedico a la tecnología desde hace más de 20 años y desde hace dos tengo una empresa de desarrollo tecnológico de IA para empresas. Perfecto. Eh, una vez que lo escribo o lo copio, le doy a la voz, selecciono la que quiero, que es voz de Pablo, o más voces. Le doy a más voces y veo todas las voces que hay. Yo puedo elegir la que quiera. En este caso he seleccionado la mía, la voz de Pablo. Si quiero la de élite, le doy a utilice y me aparecerá la de élite.

Pero no, yo quiero la voz de Pablo, como la ha seleccionado antes, me aparece por defecto aquí. Bien. Y en este segundo párrafo, pues puedo poner otro texto, seleccionar otro narrador y así se van intercambiando. Si yo quiero y lo y necesito que sea así o directamente, como no voy a escribir nada, pues al ponerme por encima aquí le doy a eliminar y ya está. y me quedo con este con este párrafo solo. Muy bien. En la derecha vemos algunas opciones, bueno, resumen de la voz, el modelo, voy a dejar el que me aparece por defecto, el S2.1 Pro, volumen, velocidad y algunos parámetros más que te invito a que investigues.

Le doy a generar discurso. Hola, soy Pablo Martínez, profesional divulgador. Wow. Vale, okay. Eh, es que lo lanza automático, por eso lo he parado. Veis que eh pone dos opciones, lo he comentado antes, siempre pone dos opciones para ofrecernos eh mayor calidad, ¿no? Eh, esta es la primera. Y formador de inteligencia artificial para empresas. Me dedico a la tecnología desde hace más de 20 años. Vale. Y la segunda. Hola, soy Pablo Martínez, profesional, divulgador y formador de inteligencia artificial para empresas.

La verdad es que es espectacular, ¿eh? O sea, es que soy yo. E, insisto, y esto está hecho con la la clonación instantánea. Bien, bueno, pues ya está. Eh, son las dos opciones que hay. Y me gusta porque dice hola y la exclamación fíjate como la usa para expresar, ¿no? O sea, quiero decir que la interpreta, la interpreta bien. Eh, me gusta más la segunda. No sé si es porque la segunda ofrece más calidad, pero bueno, me ha vuelto a gustar la segunda, como en el ejemplo anterior.

Le doy a descargar, eh, y ya está. Se me descarga MP3. Y desde aquí ya puedo usar este audio para lo que necesite. Vamos a seguir viendo más herramientas. ¿Cómo crear una voz desde cero para usarlas en nuestros audiolibros, historias narradas o en cualquier proyecto que necesites? Es lo que te explicar a continuación. Para ello vamos en el menú de la izquierda, le damos a crear voz y nos aparece esta pantalla. Seguramente te resulte familiar porque es la que hemos visto al principio de este vídeo cuando lo hemos dado a voz personalizada aquí arriba a la izquierda.

Es una pantalla con las mismas opciones. Clonación de voz instantánea, que es lo que hemos hecho antes, clonación de voz profesional, que hemos visto lo que es y te he invitado a que la probaras si querías. Y nos faltaba esta opción, diseño de voz, que es la que vamos a ver ahora. Dice, "Describe la voz en texto simple y te dará una muestra de unos 15 segundos." Bueno, pues hacemos clic y llegamos aquí. ¿Qué tenemos que hacer aquí?

No tenemos que escribir el texto que queremos que lea la voz, ¿no? Vamos a crear la voz que queramos. Eh, yo no soy experto ni editor de fotos, ni creador de vídeos, ni describiendo voces, desde luego. Pero no te preocupes porque Fish Audio lo interpreta de una forma bastante adecuada. Te voy a poner un ejemplo rápido. Aquí tienes que describir cómo quieres que sea tu voz. Por ejemplo, un narrador de mediana edad, cálido y con voz ligeramente rasposa.

Es el ejemplo que te pone aquí. Con un suave acento estadounidense americano. Ritmo calmado y pausado, ideal para audiolibros nocturnos. Y luego te pone aquí algunas algunos ejemplos para son iniciadores para que ayudarte a dar ese paso. Por ejemplo, locutor cálido de radio nocturna. Hago clic y aparece este pron que describe la voz. Un locutor de radio nocturna cercano y cálido de unos 30 y muchos con una voz suave y algo ronca. ritmo relajado y sin prisa, con alguna risita cómplice de vez en cuando, como si le hablara a un único en una habitación en silencio.

Eso es lo que dice el prom. Perfecto. Pues aquí le puedes poner el prom que quieras. Eh, le e no cuanto más le describas el prom, pero tampoco te obsesiones mucho con esto porque no somos expertos en este tipo de de descripciones de voces, pero F audio lo hace muy bien porque analiza el pron del usuario. Esto lo hacen todas las de texto, de imágenes y demás. Lo que hace es analizarle el pron de usuario y lo desarrolla para dárselo a su modelo, que es el modelo propio de Fix Audio, y así obtener la mejor la respuesta de mejor calidad.

Recuerda que todos estos modelos de IA tienen como único objetivo darte la respuesta de mejor calidad porque quieren que lo sigas usando. Ese es su objetivo. Por ese motivo se esfuerzan tanto en mejorar lo el análisis de los prom. Bueno, pues le doy a generar eh muestras a ver qué pasa. No sé cuánto tiempo va a tardar en generarlo. No sé si parar el vídeo para no hacerte perder mucho el tiempo y luego te digo tiempo y resultados.

Pues mira, ha tardado 3 segundos más. Si lo sé, no lo corto. Aquí tengo las dos pruebas. Eh, recuerda que siempre Fish Audio te da dos muestras para que elijas la que más te guste. Esta es la primera. Bienvenidos de nuevo, mis queridos oyentes. Aquí estamos bajo el manto de la noche. Espero que se encuentren cómodos, quizás con una taza de algo caliente entre las manos. La verdad que es impresionante. Vamos a darle a esta.

Bienvenidos de nuevo, mis queridos oyentes. Espero que estén tan cómodos como yo aquí. Mira, mira y suspira y todo. Vale, vale, me ha molado esta. Pues no sé si porque la segunda opción de momento me estoy quedando siempre con las segundas opciones. Le doy a seleccionar. Eh, muy bien. Continuar. Y ah, y ahora lo que hago es rellenar la ficha de la voz como hemos hecho anteriormente. Bueno, pues aquí le pones el nombre, le pones eh la clasificas, la etiquetas como creas conveniente, aceptas las condiciones de que confirmas que tienen los derechos de uso.

Pues sí los tienes porque la acabas de crear tú. Le das a crear voz y se te agrega e la creas. en tu entorno de de fish audio para poder reutilizarla como hemos visto en ejemplos anteriores. Y ya está. El proceso es sencillo y lo hemos hecho antes, así que de esta forma la creamos. Le podemos poner el voz de narrador narrador Pablo. La descripción es esta, las etiquetas las dejo. Es pública o le puedo dar decir no listada o privada.

Confirmo, le doy a crear voz. Crea la voz y ya está. Continuamos con más herramientas. Cómo crear efectos de sonidos para que puedas usar en tus proyectos es lo que te voy a enseñar a continuación, porque no solo de voz vive el ser humano. Vamos a ver cómo se crean. Para ello vamos al menú de la izquierda. efectos de sonido. Y esto está francamente bien. Es una biblioteca de efectos de sonido. Puedes buscar directamente.

Te voy a poner un ejemplo. Tienes sonidos de río, de trueno, de disparos, por ejemplo, de río. Está muy bien. La verdad es que tengo que reconocer que es muy práctico. Yo como creador de contenido estos tipos de sonidos los uso. Está muy bien porque son sonidos que no están protegidos por derechos de autor y los puedes utilizar. Están creados cona, pero los puedes disparosiones. Bueno, pues esto, esta es la biblioteca de sonidos que puedes utilizar.

Te los descargas desde aquí y ya está. Luego, si te fijas, aquí tienes una ventana de pronting. ¿Para qué? Para crear tus audios, tus efectos de sonido. Ojo, los puedes crear desde cero, escribiendo lo que tú quieras. O también puedes aprender sobre cómo se ha creado este. Fíjate qué fácil. Le doy, si le doy aquí, se reproduce, pero si le doy, si le doy aquí, lo descargo. Pero si le doy al lápiz, ¿qué ocurre? Pues que me aparece el pron y fíjate el pron cómo es flujo de río interrumpido con agua salpicando.

Ya está. O sea, desde ahí tú le puedes describir o le puedes mejorar el promes llevar a otra para que te te haga un megapron y pegarlo aquí para darle más información todavía a Fix Audio y que te dé mejores resultados. Aquí tienes algunos ejemplos de contenido social. Por ejemplo, si hago clic, va a aparecer un prom de tipo eh contenido social, un sonido de notificación de aplicación móvil moderno y minimalista, un pop suave y brillante con un tono ascendente.

Bu, como puedes ver, h tienes efectos de todo tipo. Aquí tienes las opciones de configuración del efecto, pues tienen la duración hasta un máximo de 60 segundos. Aquí tienes eh los pasos si quieres que sea de más o menos calidad. Y luego tenéis aquí eh si lo quieres más, ¿cómo lo quieres de creativo? Yo esto lo he dejado por defecto, la verdad, y yo creo que es suficiente. Ahora le damos a, por ejemplo, a enviar. Vamos a crear este sonido de aplicación a ver qué tal.

Le da generando, aparece este cartel aquí generando. Lo que voy a hacer va a ser pausar el vídeo para no hacerte perder el tiempo. Y ahora te digo cuánto tardado y te enseño el resultado. Unos 7 segundos ha tardado aproximadamente en hacerlo. Ya me aparece aquí como generado. Le doy a desplegar y este es el sonido. Un sonido de notificación. Perfecto. Me aparece en el historial, si te fijas, eh, explorador y historial.

Y aquí están todos. Muy bien. Le doy aquí. Claro, es que fíjate, es un pop. Bueno, igual tenía que haber sido de 5 segundos. Fíjate cómo se va moviendo. Y ahora hace el pop. Claro. Aquí evidentemente este sonido, este efecto de sonido de 10 segundos no tiene sentido. Lo suyo es hacerlo de 5 seg de cinco no, de 2 segundos directamente para no comernos toda esta línea de tiempo. Aunque bueno, también lo puedes editar o incluir algún segmento que coincida en tiempo.

Yo esto también lo hago así. Hay efectos que son siguen esta estructura, ¿vale? para dejar tiempo al editor o espacio al editor para hacer la composición adecuada. Bueno, pues de esta forma se pueden podéis podemos reutilizar los efectos de sonido y crear lo que nosotros queramos. ¿Cómo crear vídeos con las imágenes que quieras y audios que necesites y sincronizarlos para que parezca que la persona esté narrando o diciendo esa historia?

O es más, cómo crear tu propio avatar y decir lo que quieras con tu voz es lo que te voy a enseñar a continuación. Para ello nos vamos a la parte izquierda de FIS audio donde dice imagen y vídeo, que es además nuevo, es una nueva funcionalidad. Hacemos clic aquí y a continuación lo que vemos es esta pantalla en la que se nos presentan algunos ejemplos que podemos ver. Por supuesto que sí. Vemos en explorar e historial.

Si te apareciera, si todo en blanco es porque quizás tengas el historial y si no has hecho nada estará vacío. Yo tengo un ejemplo que es el que te voy a enseñar ahora después. Bueno, en explorar vemos otros ejemplos. Por ejemplo, este de este chico. Eh, la verdad es que está muy bien. Bueno, este caso está en inglés, pero lo importante es que veas que es en formato horizontal y que aquí a la derecha vemos siempre el prom que se ha usado para crear este vídeo y las características.

Eh, es un avatar en este caso en resolución 720 y 64,000 créditos es lo que se ha gastado en usar en crear este vídeo. Podemos ver otros como por mira este anime está muy guay. La verdad que puedes hacer auténtica maravillas. Vamos a ver el de esta chica. Me encanta perderme por estas calles. Cada rincón tiene su propia historia. En este caso es un avatar. Fíjate como no hay pron a la derecha, simplemente le han dado una imagen y el audio, ¿vale?

Y desde ahí ha creado lo que has visto. Voy a ponerte otro ejemplo de este chico. A veces solo hay que dejar que la ciudad te lleve. ¿Ves? Igual, exactamente igual. También puedes ver los ejemplos aquí abajo, ¿eh? Vas que de otra forma más rápid es más cómoda para mí. Esto es una imagen. En este caso, esto es otro vídeo. Este disfrutar el momento es lo único que importa. Bueno, pues hay un montón de ejemplos. Esto eh eh os lo enseño porque el objetivo es que eh veas o veáis fuentes de inspiración, bien, incluso ver los pron que han usado, las características, los créditos que han usado y demás.

Bueno, eh eso es lo que vemos en en esta primera biblioteca, ¿no? De ejemplos. Luego vemos aquí abajo en la ventana de Promis en la que hay tres opciones. Imagen para crear imágenes directamente. Esto es lo está integrado. Ves que está como encima de las imágenes. Perfecto. Podemos crear imágenes y para ello le llamos imágenes de referencia y audio, ¿no? Porque no tiene sentido. Y le ponemos el prom que queremos y ya está.

No te voy a poner, no voy a hacer ningún ejemplo contigo en tiempo real porque eh no me quiero quedar sin créditos para terminar de hacer el tutorial, aunque pueda hacer todavía imágenes de sobra, pero es con los créditos que tengo, ¿vale? Por ejemplo, ya he gastado con las pruebas que he hecho los vídeos y por ese motivo no quiero seguir haciéndolo con los vídeos, eh, si le doy a vídeo, eh, aquí te da la opción de eh subir una imagen de referencia, audios de referencia, eh otros vídeos de referencia con los que pueda construir.

Te dice el modelo que va a usar. Eh, puedes elegir el modelo con el que quieres que cree el vídeo, Minimx, Sidams, el 2.0, 2.5, eh, One 3.0, Clean. Estos modelos seguramente te suenan. Y si no te suenan, ya te adelanto que son los modelos, los mejores modelos para la creación de vídeo con inteligencia artificial que hay en la actualidad. Aquí podéis elegir el formato 916, formato vertical, la duración, la resolución.

Te sugiero que para hacer pruebas o antes de tener el vídeo definitivo lo hagas siempre en baja resolución porque es lo que menos créditos te gasta y lo que más rápido va. Bueno, pues de esta forma puedes crear vídeos y o te puedes crear tu avatar, que es el ejemplo que te voy a enseñar. Un avatar es una representación de ti lo más realista posible con tu voz si quieres también contando algo, diciendo algo. Yo he hecho algo a muy baja resolución y con una fotografía que no está mal, desde luego.

No es la mejor porque salgo de lado, no enseño los dientes y la I aquí ha tenido que trabajar un poco más, que es esta fotografía de aquí. Yo desde esta fotografía eh y mi voz, que la he extraído de los ejemplos anteriores, cuando hemos clonado mi voz, ¿recuerdas que he leído, le he hecho leer? Hola, soy Pablo Martínez, eh, profesional, divulgador y formador de IA para empresas. una frase bien, pues he usado esta fotografía y ese audio.

Me he venido a sincronización labial, le he subido eh esa fotografía y ese audio. Esto es otra prueba que que iba a hacer y al final no he hecho. Vale, le he puesto hace un vídeo, el prono, hace un vídeo de presentación profesional, le he dado a enviar, ha tardado en hacerlo aproximadamente unos 3 minutos y me ha generado esto que vas a ver, este vídeo de aquí hago ves que se está moviendo. Esto es lo que me ha generado.

Hago clic. Soy Pablo Martínez García, profesional, divulgador y formador de inteligencia artificial para empresas. Me dedico a la tecnología desde hace más de 20 años y desde hace dos tengo una empresa de desarrollo tecnológico de IA para empresas. Está muy bien. Pensad que esto lo he hecho a la primera. Esto, ¿cómo se llama? Un one shot. La imagen quizás no sea la mejor. El audio tampoco estaba hecho con IA. Si lo hubiera grabado yo de forma natural, eh, y lo hubiera se lo hubiera dado, quizás lo hubiera se hubiera escuchado bastante mejor.

Quizás no seguro, porque ya sabes que esación que he hecho al principio era instantánea y tal, pero aún así hemos pasado de cero a esto en 3 minutos, que es lo que me ha costado eh conseguir hacer este vídeo. Una vez que lo hago, que te lo enseña, lo puedes ver, te lo puedes descargar y aquí te muestra las características. Bueno, el PROM, como ya hemos visto antes, te enseña el tamaño, las dimensiones, que es un avatar.

Lo he hecho con la función de avatar, la resolución y los créditos. 68,000 créditos he gastado para hacer este vídeo, un vídeo de unos 10 segundos más o menos, creo que es. Bueno, pues de esta forma podemos crear eh imágenes tal cual, vídeos e, incluso con un fotograma inicial, un fotograma final para que desarrolle toda la escena con los modelos de creación de vídeo que que ejecuta Fish Audio y luego la sincronización labial también para crear tu avatar.

De esta forma creas tu avatar tal cual. Te invito a que pruebes estas opciones porque de verdad que son espectaculares. Cómo aislar la voz en un fichero de audio que tengas con ruido, sonido ambiental. Es lo que te voy a explicar a continuación. Nos vamos a la parte izquierda de fish audio y damos a la opción de separación de audio. Hacemos clic y aparece esta esta pantalla, separación de audio. Sube el fichero que necesites y te separamos el audio.

Vamos a ver si lo hace. ¿Qué fichero vamos a usar? Pues el vídeo de mi avatar que me he descargado. Te he enseñado antes y me he descargado ya. Soy Pablo Martínez García, profesional. Perfecto. Un fchero de 17 segundos que vamos a tal cual y vamos a arrastrar y soltar. A continuación me dice, "Oye, ¿para qué lo quieres aislar?" Para voz, la batería, bajo, piano, identifica distintos instrumentos para que veas y te lo extrae, te lo aísla.

Bueno, voy a decir que quiero las voces, solo separar audio. Hago clic aquí en el botón, perfecto, me dice los créditos que me va a consumir, en este caso 822 de los que tengo restantes, y empieza a trabajar. Voy a parar el vídeo para no hacerte perder el tiempo y ahora te cuento tiempo y te enseño resultados. unos 30 segundos aproximadamente más tarde, termina y me lanza directamente a esta pantalla. Fíjate como dice aislado fish audio Creati Aurora, Avatar, es decir, el aislado y el nombre del fichero.

Perfecto. Hago clic aquí. Soy Pablo Martínez García, profesional, divulgador y formador. Perfecto. En este caso no había ruido ni había sonido ambiental porque era el audio de ese vídeo, pero el objetivo era que vieras cómo extraía el audio. Si le metes un fichero con ruido, lo va a extraer con una calidad que estoy seguro te va a sorprender. ¿Cómo analizar un vídeo o un fichero de audio y extraer todo el contenido en formato texto para que lo podamos manipular?

Es lo que te voy a enseñar a continuación. Para ello vamos a la parte izquierda, como siempre, fish audio, a la herramienta conversión de voz a texto. Vemos esta pantalla. Tras escribir e historial. Lo tengo vacío. Transcribir, pues voy a transcribir este vídeo que hemos hecho antes. Perfecto. Es exactamente el mismo. Muy bien. Pues eh lo voy a y lo voy a arrastrar. me dice que el tamaño máximo es de 1 GB en tamaño del fichero y en duración 10 horas.

Pues ya está, lo subo. A continuación me dice número de hablantes que lo detecta automáticamente. Le voy a decir que sí, que quiero reemplazar el fichero cuando termine de crearlo. Eso da igual, vas a ver por qué. Le doy a crear tarea y empieza a trabajar. Ahora voy a parar el vídeo y luego te enseño, te cuento tiempos y resultados. está procesando. Ahora me ha traído a esta pantalla donde imagino que aparecerá el texto.

Voy a pararlo y luego te luego te cuento. Ha tardado apenas 10, 12 segundos y me muestra esto. Me dice el speaker 1, spk 1. Solamente hay un un orador que soy yo, en este caso un locutor. Y aquí por las marcas de tiempo y las frases que digo. Perfecto. Y a continuación me lo pone aquí el play para que lo revise. Soy Pablo Martínez García, profesional, divulgador y formador de inteligencia artificial para empresas. Está muy bien.

Me dedico a la tecnología. La verdad es que es una herramienta muy útil. Eh eh yo en alguna ocasión la he echado en falta. Tengo que decir que es potentísimo y me gusta mucho como luego e te permite comprobar, revisar, ¿no? Que a veces es lo más importante. Bueno, pues aquí tienes eh esta otra herramienta de F audio que estoy seguro que a muchas personas les va a ayudar. ¿Cómo cambiar la voz de un audio? es lo que te voy a enseñar a continuación con esta interesante herramienta.

Vamos a ver cómo funciona. Vamos a la parte izquierda, cambiador de voz. Me dice cambiador de voz. Arrastra un archivo de audio o haz clic para subirlo, MP3, W, como sea. Le voy a dar a subir y le voy a subir el fichero de audio de mi voz en ese en el que me presento, que hemos usado varias veces en este vídeo. A continuación le voy a decir voz de referencia. Seleccionar modelo de voz. Hago clic aquí, le doy narrador Pablo o no.

Le voy a decir a élite, ¿vale? utilizar élite y ahora le voy a decir a convertir audio. Va a gastar 834 créditos. Perfecto. Le doy a convertir audio. A ver qué pasa. Paro el vídeo y luego te digo tiempos y te enseño resultados. Pues ha tardado otros 10, 15 segundos como máximo. Y este es el resultado. Me ha traído directamente a esta pantalla. Recuerda que siempre cuando termino una tarea te lleva siempre la pantalla de historial para que la veas.

La última. Vale. Eh, solamente he hecho una que es esta. Vamos a ver qué qué ha salido. Hola, soy Pablo Martínez, profesional, divulgador y formador de inteligencia artificial para empresas. Me dedico a la tecnología desde hace más de 20 años y desde hace dos tengo una empresa de desarrollo tecnológico. Qué fuerte es. lo ha hecho muy bien, lo que la verdad que es impresionante y estoy seguro que se me ocurren cosas para utilizar esto y estoy convencido que a ti, a ti, a ti también porque tiene un montón de utilidades.

Lo que ha hecho ha sido analizar mi audio, extraer el texto y volverlo a grabar con la voz de élite de ese otro narrador que hemos seleccionado. Bueno, pues de esta forma podemos cambiar la voz de cualquier audio que le subamos. ¿Cómo crear un agente de inteligencia artificial que responda con voz las llamadas que reciba, asumiendo el rol, por ejemplo, de atención al cliente, soporte a usuario o de asistente a los empleados de una empresa, quizás de tu empresa, al que llaman para responderle sobre dudas relacionadas con contabilidad, con recursos humanos o con el convenio de la empresa.

Pues todo esto es lo que te explicar a continuación. No sabía si incluir este punto en el vídeo porque digamos que es un paso más allá, es un uso más avanzado de esta plataforma, pero la realidad es que la función de agentes, el modo agente, me ha gustado tanto y la he visto, he visto una opción tan potente que he decidido incluirlo. No lo vamos a ver en profundidad. Si quieres que haga otro vídeo en profundidad sobre los agentes, dímelo y hago un vídeo solo sobre esto.

Ahora vamos a te voy a enseñar por encima qué son y cómo los puedes crear. Ojo, y los vamos a probar al menos uno, el que he creado. Nos vamos a los modos de uso de de fish audio. Te lo he enseñado al principio de este vídeo. Arriba a la izquierda, haces clic, despliegas y seleccionamos agentes. Una vez que estamos aquí, entramos en el entorno de creación y gestión de agentes. digo gestión porque desde aquí tenemos un dashboard con todo lo que han hecho nuestros agentes, métricas, las bases de conocimiento para subirle los ficheros que queremos que usen como su conocimiento y para dar respuestas a los usuarios.

Podemos ver las herramientas, activar y desactivar a qué herramientas tienen acceso, búsqueda web y otras muchas. Podemos hacerle pruebas, análisis, vemos los históricos de las conversaciones y un montón de cosas más. Vamos a ver cómo se crea un agente. Aquí en agentes yo he creado uno que se llama Elías, que es el que te voy a enseñar y vamos a probar juntos. Para crear un agente le damos al más, le ponemos el nombre a la agente, le voy a poner en este caso Sofía y le doy a crear agente. se abre esta pantalla en la que pone el pron del sistema, que es le tenemos que decir qué queremos que haga la gente, qué rol tiene que asumir, cómo tiene que comportarse y el primer mensaje, si queremos que eh diga un primer mensaje cuando comienza la conversación, lo podemos desactivar, mensaje fijo o le podemos poner un prom para que decida qué cómo saludar o cuál es su primer mensaje en base a lo que le diga el usuario.

La zona horaria en este caso Madrid y luego en la parte derecha tenemos la voz. Podemos elegir cualquier voz de las que tenemos en la plataforma. Puede ser, por ejemplo, una tuya que te hayas clonado. No digo que sea la mejor opción, pero lo puedes utilizar. Hay varias opciones de velocidad del habla, el modelo que quieres usar. En este caso es el modelo para analizar lo que se va diciendo, ¿no? Para generar la voz y un montón de opciones más.

De esta forma se diseña un agente y ya está. A continuación le das a publicar y haces una llamada de prueba. Perfecto. ¿Y esto funciona o no? Vamos a verlo. Voy a seleccionar aquí el el selector de agentes y voy a ver a Elías, que es un agente que yo me he creado antes. Fíjate como tiene un system prom. Está hecho con Macdown para que lo entienda lo mejor posible. Es un pro semiprofesional de creación de agentes. Está muy bien.

Perfecto. En este caso, lo que le he dicho eh a la gente es que actúe como asistente sobre el uso de la inteligencia artificial en mi empresa. va a ser un agente al que voy a poner a disposición de los empleados de mi empresa, de mi equipo, para que cuando tengan una duda sobre si pueden usar la inteligencia artificial o no, puedan preguntarle directamente a este agente. Y para ello, lo que le he dado ha sido este documento.

Aparte de este pron que define cómo tiene que comportarse, le he dado en su base de conocimiento le he cargado este documento, que es un documento en PDF de 17 páginas en el que defino el protocolo de uso de la inteligencia artificial en mi empresa. ¿Qué tienen que hacer las personas, los empleados cuando quieran usar la IA? Si no saben si pueden usar la no, tienen que preguntar, tienen que saber qué tipo de información pueden subirle, qué preguntas pueden hacerle, en qué momentos le pueden preguntar y qué cosas y qué cosas no.

Todo eso está descrito en este documento. Bueno, pues lo que he hecho ha sido a Elías en su base de conocimiento le he subido el protocolo de ella. ¿Por qué? porque así él va a saber que en esa en ese documento están la mayoría de las respuestas y si no las tiene pues entonces le dirá al usuario que contacte con el responsable de los sistemas de información en este caso. Bueno, pues aquí tenemos el prom, aquí tenemos el primer mensaje que es un mensaje fijo.

Hola, soy Elías, el asistente de la empresa de la empresa. ¿En qué puede ayudarte hoy? Y a continuación le he puesto esta voz aquí a la derecha. Le he puesto la voz de Farig, que es una voz en español. La velocidad habl normal y esto lo he dejado tal cual. Cuando he terminado de diseñar a la gente, te lo estoy enseñando así de una forma muy rápida, le he dado a publicar porque no ahora no aparece lo de publicar porque ya está publicado, no hay ningún cambio.

Si yo le diera a espacio o le metiera algo más, ¿ves? Se aparecería lo de publicar. Eh, hecho una modificación, lo voy a publicar contigo simplemente para que lo veas. Más me dice, "Oye, ¿lo quieres publicar?" Perfecto. Pues sí, le doy que sí. Y a continuación hago una llamada de prueba y vamos a ver qué hace. Espero que lo escuches. Iniciar llamada. Le Bueno, me voy a mover porque si no no lo vas a ver. Me vengo a aquí.

Disculpa. Ahí está. Me voy a venir aquí a la otra parte. Muy bien, inicio la llamada de prueba para que lo escuches. Hola, soy Elías, el asistente de IA de la empresa. ¿En qué puedo ayudarte hoy? Hola, Elías. Me llamo Pablo, trabajo en el departamento de contabilidad y necesito saber si le puedo subir los últimos balances de la empresa Achas GPT para que lo analice. Hola, Pablo. Lo siento, pero no está permitido subir balances ni información financiera a plataformas externas como ASAGPT sin autorización.

Debes utilizar únicamente las herramientas homologadas por la empresa y asegurar la confidencialidad de los datos. ¿Y cómo puedo saber cuáles son esas herramientas que están autorizadas por la empresa? Puedes consultar el listado oficial de plataformas homologadas directamente con el equipo de tecnología y seguridad. Es me parece, o sea, esto esto ha sido en tiempo real. Eh eh esta prueba podía haber salido de muchas formas y ha salido como me han salido las anteriores que he hecho.

Es que es rapidísimo. O sea, fijaros la velocidad a la que cuando yo estoy hablando en tiempo real online, esto es tiempo real, está transcribiendo lo que yo digo para que la lo entienda y el modelo de Fish lo que hace es interpretarlo y genera la voz a una velocidad realmente increíble. Es alucinante. Bueno, pues estos agentes disponen de un conjunto de APIs para que los puedas integrar en cualquier servicio de comunicación.

Bueno, en casi todos, en los más importantes, tienen APIs, toda la documentación para que estos agentes que tenes aquí, que crees aquí, los puedas usar donde quieras y puedas, por supuesto, luego gestionarlos y supervisarlos, que es lo más importante de esta parte de agentes. Me a mí me ha gustado mucho usar esta esta función, por eso he querido compartirla en el vídeo. Es muy eficaz crear agentes así, extremadamente rápido y es que funciona muy bien.

Por ese motivo lo he incluido. Espero que te haya gustado. Si quieres que haga un vídeo hablando solo sobre esto, déjamelo en comentarios y lo hago. ¿Cómo conectar Fish Audio con la inteligencia artificial con la que trabajemos habitualmente? chat GPT, Cloude, ojo, o con cualquier aplicación de programación o codificación que usemos en nuestro día a día. El único requisito es que tiene que ser compatible con MCP, seguro que te suena Model Context Protocol.

No te preocupes, es una forma muy sencilla de conectar aplicaciones externas como FIS Audio a las IAs más habituales, pues ya te digo, CH GPT, Clou, Yemina y un montón más para poder usar los servicios de esos eh de esas plataformas externas dentro de nuestra yo, por ejemplo, uso Cloue en la que uso todos los días, no porque sea la mejor, es porque es la que más me gusta. tengo todos mis proyectos hechos, skills y la verdad es que trabajo una barbaridad con Cllaude y por algún motivo es posible que necesite crear audios o trabajar con voces, con documentos eh o con documentos de audio para trabajar con ellos directamente desde Cloue y no tenga que irme a Fish Audio para hacerlo.

Bueno, pues para ello podemos conectar Cloue con Fish Audio mediante el protocolo MCP. Para ello vamos a hacerlo, o sea, vamos a conectar cloud y esto lo podéis hacer igual en chat GPT. Nos vamos al signo más, vamos a conectores. A continuación añadir conector, le damos a añadir conector personalizado. Hacemos clic, aparece esta pantalla, le ponemos el nombre, en este caso va a ser fish eh audio. La URL del servidor MCP es esta https/api.fish. audio/mcp.

A continuación le doy a continuar y va a hacer una serie de chequeos. Esto es buena, esto es esto es buena cosa porque quiere decir que se ha conectado a esa URL, que si yo la abro en un navegador no vale porque no es compatible con un navegador, se tiene que hacer directamente desde aquí. Esto es bueno porque ha dicho, "Oye, me he conectado. ¿Cómo quieres autenticarte? ¿Quieres iniciar sesión ahora? ¿Quieres hacerlo con un cliente o out? ¿Cómo lo quieres hacer?" Yo voy a dejar todo por defecto y a continuación le voy a dar añadir.

Voy a parar el vídeo porque no quiero que salga ninguna pantalla con datos de inicio de sesión. Ahora lo vuelvo a activar y te cuento lo que he hecho. Le he dado a activar o añadir era el botón y me ha aparecido esta pantalla. Clude quiere acceder a tu cuenta de fix audio. Esto permitirá a Clou usar las herramientas de audio con IA, generación de voz, transcripción, ¿ves? Directamente desde Cloude. Le voy a decir autorizar.

Vuelvo a parar el vídeo porque no quiero que me aparezca ninguna pantalla rara. Y ahora te cuento. Le he dado a autorizar y como ya estoy logado arriba, me aparece aquí abajo conectado a Fish Audio. No he tenido que hacer nada más porque ya ha detectado que estoy autenticado en el mismo navegador y yo creo que teno que las credenciales de alguna forma, alguna cookie de sesión tiene que haber para conectarse. Perfecto, ya estoy conectado a Fish Audio para ver si es cierto o no.

Me voy al más. Ahora me voy a conectores y veo que tengo aquí fish audio y con el logo, ¿ves? Está conectado. Pero ojo, no es porque tenga la pestaña abierta, la puedo cerrar sin ningún problema. La cierro y sigue estando conectado mi cloud a fish audio. Desde este momento yo puedo pedirle a Clou cualquier trabajo de los que hago en Fish Audio, en la plataforma de FIS Audio, directamente desde aquí. Por ejemplo, le voy a decir que quiero que crees eh un audio, un audio con la voz de Pablo en español.

Esto es complicado porque le estoy diciendo que cree un audio con mi voz en español. Se va a tener que ir a buscar a Fish Audio la voz de Pablo en español. No sé si va a encontrar o me va a pedir que le diga el ID de la voz con el que quiere que lo haga. Eh, quiero que queres un audio con la voz de Pablo en español y que diga esto. Hola, hola, estoy conectado o me han creado, han replicado mi voz desde Claude, la voz de para español desde eh bueno, le voy a decir mejor para ir más exacto.

Quiero que quiero que uses quiero que uses fish audio para crear para crear un audio con la voz de palo en español. Perfecto, yo creo que es suficiente. Bueno, pues este es el prom que le voy a mandar, le doy a enviar y vamos a ver lo que hace. debería identificar que debería analizar el prom, identificar que está conectado a la herramienta Fish audio y usar las herramientas de Fish audio para crear esto. Ey, Claude quiere usar search voice de Fish audio.

Claude se ha conectado a Fish Audio y que está buscando la voz correcta. Permitir siempre, le voy a decir permitir siempre para que sea más tal. Ojo porque ojo, ojo, qué guapo, tío. Ojo porque ha encontrado las dos narrador Pablo y voz de Pablo. Dice, "Eh, ya tienes una voz clonada llamada voz de Pablo en tu workpace. La uso para generar el audio." Perfecto, me parece. Voy a decir, "Permití una vez." Muy bien. Wow, tío.

A ver, este Claudio se ha conectado por un servidor MCP. Lo que está Wow, tío, ya lo ha hecho. No puede ser. A ver. Hola, han replicado mi voz desde Cloud. O sea, está muy bien. No esperaba que fuera tan rápido. Lo que está haciendo es conectarse por eh MCP. Lo hemos conectado. Y cuando se conecta por MCP es un protocolo de comunicación estándar, model context protocol, como te he comentado antes, y lo que hace es hacer llamadas a la API de Fish Audio de la aplicación.

Eh, pero vuelvo a insistir, yo tengo que deciros que me ha sorprendido mucho. Hm, es muy rápida, eh, no hablo de Cloud, que lo ha hecho bien, ha hecho lo que tenía que hacer y ya está, pero me sorprende mucho la velocidad de fish audio. E no es por echarle flores a la plataforma, pero es verdad que me sorprende bastante. Bien, bueno, pues de esta forma podemos crear una voz en tiempo realmente Cloue o desde cualquier otra a que uses.

Ojo, y te digo voces. Me dice, fíjate, es curioso, no te lo he dicho. Me dice los créditos que ha consumido, que son 39 créditos, por ejemplo. Desde aquí puedo usar Cloue para hacer eh análisis de texto, resúmenes y decirle que me cree directamente las voces eh o el texto narrado audible en Fix Audio. Para eso valen estas integraciones, para facilitarnos nuestro trabajo diario. Espero que te haya gustado esta funcionalidad.

Ojo. Y si quieres que profundice más y hagan más causas de uso sobre esto, dímelo también en comentarios y lo hago. ¿Cuál es mi opinión sobre Fish Audio? Solo puedo decirte que me ha encantado. Me lo he pasado muy bien haciendo este vídeo. Me ha sorprendido desde el inicio hasta el final, como has visto con este ejemplo sobre cómo conectar fish audio por MCP a Cloude. Sobre todo la velocidad de respuesta ha sido espectacular.

Ahora piensa cómo te puede ayudar esto en tu día a día, en proyectos, conectándolo a la illa con la que trabajes a diario, porque estoy seguro que le puedes sacar muchísimo rendimiento. Tienes el enlace para registrarte aquí abajo en la descripción y en el primer comentario. Y recuerda que también te invito a que te suscribas a nuestra comunidad privada y gratuita de IA. Ya somos más de 25,000 personas aprendiendo a todos los días. información, actualidad, un montón de recursos como cursos de IA, biblioteca de documentos, un montón de cosas para que estés al día de todo lo que pasa en el mundo de la IA.

Sígueme en esta red social, deja un like a este vídeo y un comentario con la palabra comunidad y te envío una invitación para que accedas ya. Ah.

The words are the caption track's own and nothing is reworded or re-transcribed. Paragraph breaks are placed between sentences so the text reads as prose.

Use this transcript

Three free tools that work on the material around a video like this one. No signup, no login.

🚀 Fish Audio: La Alternativa a ElevenLabs (Clona tu Voz + Agentes de Llamadas + MCP con Claude): Full transcript