ElevenLabs: es dedica a crear veus sintètiques molt realistes: Text-to-Speech (TTS), clonació de veus, doblatge, agents de conversa per veu, etc.
Aspectes destacats
Suport per molts idiomes — ElevenLabs diu que ofereix més de 70 idiomes en alguns models. ElevenLabs+1
Model amb expressivitat: no només veu “robòtica”, sinó que l’IA intenta captar emocions, pauses naturals, articulació pròxima a com parla un humà. ElevenLabs+1
Ha estat reconeguda com una de les empreses punteres en veu amb IA, amb molts usuaris, aplicacions pràctiques i prestacions professionals.
Sora: Eina d’intel·ligència artificial desenvolupada per OpenAI que permet generar vídeos a partir de textos.
Sora és un model de IA de text-a-vídeo que transforma descripcions en llenguatge natural en vídeos, amb sincronització d’àudio.
OpenAI+3OpenAI+3OpenAI Help Center+3
També té una app social amb el mateix nom (“Sora”) basada en la versió Sora 2 del model, dissenyada per generar i compartir vídeos curts,
permetre remixes de vídeos d’altres persones, i incloure cameos (és a dir, inserir la teva imatge o veu en un vídeo generat)
Com funciona / quines opcions té
Pots generar un vídeo de fins a 10 segons (en molts casos) simplement descrivint l’escena: subjecte, ambient, moviment, càmera, so, etc. EL ESPAÑOL+3OpenAI Help Center+3The Verge+3
També pots començar a partir d’una imatge per animar-la. OpenAI Help Center+1
Permet remesclar (“remix”) vídeos d’altres usuaris per fer variants creatives. OpenAI Help Center+1
Els “cameos” permeten que l’usuari faci una gravació prèvia de video i audio per capturar la seva aparença i veu, i inserir-se en vídeos generats. OpenAI+1
Kling.ai: és una eina d’intel·ligència artificial desenvolupada per la companyia xinesa Kuaishou Technology que serveix per generar vídeos a partir
de text (text-to-video) i també transformar imatges en vídeo.
Avantatges
Permet crear vídeos visuals molt atractius sense necessitat de filmar tot des de zero.
Ideal per a creadors de contingut, publicitat, storytelling, educació, etc.
Llarga durada (fins a 2 minuts) respecte a moltes eines similars que només generen clips molt curts.
Limitacions / riscos
Pot haver-hi barreres de llengua i accés si no parles xinès.
La qualitat depèn molt de com escrius el prompt; pot caldre fer bastants proves per obtenir un resultat que satisfaci.
Com tota eina de vídeo IA, hi ha qüestions d’ètica, drets d’autor, permissions si envies imatges de referència, etc.
També hi ha queixes d’usuaris sobre problemes amb subscripcions, gestió de crèdits, atenció al client.
SUNO: és una plataforma d’intel·ligència artificial que serveix per generar música (cançons completes) a partir de descripcions en text.
Com funciona
L’usuari escriu un prompt de text descrivint com vol la cançó: estil, gènere, estat d’ànim, tempo, veus, etc. Tad AI+2sunnoai.com+2
L’IA processa això i genera la cançó amb tots els components: melodia, harmonia, instrumentació, veu. Viquipèdia+3sunnoai.com+3sunnoai.com+3
Hi ha eines de personalització: per exemple, pujar un fragment d’àudio propi (instrumental o vocal) per influir en la direcció de la cançó (“extend”, “cover”, etc.). Tad AI+3Reddit+3sunnoai.com+3
Ha anat millorant amb noves versions (per exemple v4.5) que ofereixen millor qualitat d’àudio, més estils, vocals més expressives, etc. sunnoai.com+2sunnoai.com+2
Usos pràctics
Per a creadors de continguts que necessiten música de fons, jingles, intros, etc. sense haver de contractar músics o fer gravacions complexes.
Com eina de prototip per músics: generar idees, bocins de cançons, melodies, estructura.
Educació: per aprendre composició o experimentar amb estils musicals.
Pel·lícules, videojocs, jocs independents, etc., on es requereix música personalitzada ràpidament i amb pressupost reduït.
Controvèrsies i limitacions
Drets d’autor: Suno ha estat objecte de demandes per part de grans segells musicals (Sony, Universal, Warner) que l’acusen d’haver utilitzat música protegida per entrenar els seus models sense autorització. Reuters+2Forbes+2
Qualitat de l’àudio: alguns usuaris diuen que cal polir el resultat; que en molts casos no és encara al nivell “estudi professional” sense edició addicional. Artefactes, vocals que no sempre són naturals, limitacions en fidelitat, etc. Reddit+2Tad AI+2
Limitacions creativas: en estils molt específics, o amb expectatives molt altes de control (p.ex. que la veu sigui exactament com la persona), pot no coincidir plenament amb el que vols.
Ús comercial: depèn del pla i de les llicències de Suno; no tot és lliure de drets segons com ho facis servir.
GOOGLE AI STUDIO: actua com a entorn integrat per prototipar, experimentar i construir aplicacions amb models d’intel·ligència artificial generativa,
especialment amb la família de models Gemini.
Què és Google AI Studio
És un IDE (entorn de desenvolupament integrat) web per treballar amb models generatius de Google, accessible des del navegador. Viquipèdia+2Google AI for Developers+2
Permet provar els models de Google (com Gemini, Imagen, Veo, entre altres) mitjançant prompts (text, imatges, etc.), ajustar paràmetres i generar resultats. Google AI for Developers+2Google AI for Developers+2
Té com a objectiu fer fàcil l’entrada per a desenvolupadors i persones interessades a explorar capacitats d’IA sense haver de muntar infraestructures complexes.
Avantatges
Facilita l’experimentació i la exploració de models generatius d’una manera accessible i visual.
Permet integrar fàcilment el que crees en aplicacions reals mitjançant exportació de codi i API.
Bona porta d’entrada per a desenvolupadors interessats en IA sense necessitar infraestructures pròpies.
Limitacions
Tot i que pots prototipar bé, per a escales grans o aplicacions productives és probable que vulguis migrar a plataformes més robustes (com Vertex AI).
Hi haurà límits d’ús, velocitat, recursos o tarifes segons el model i la càrrega.
Certs models multimodals són experimentals o amb restriccions, depenent de l’estat de desenvolupament.