Project 1B
English - Spanish
Technology/Science Article
English - Spanish
Technology/Science Article
Color Guide: Differences between the translations are shown as blue (DeepL), purple (MateCat), and red (Mistakes).
Using more training data and computational power is meant to make AIs more reliable, but tests suggest large language models actually get less reliable as they grow, claimed Chris Stokel-Walker.
Se supone que el uso de más datos de entrenamiento y potencia de cálculo aumenta la fiabilidad de las IA, pero las pruebas sugieren que los grandes modelos lingüísticos son menos fiables a medida que crecen, afirma Chris Stokel-Walker.
El uso de más datos de entrenamiento y poder computacional está destinado a hacer que las IA sean más confiables, pero las pruebas sugieren que los modelos de lenguaje grandes en realidad se vuelven menos confiables a medida que crecen, afirmó Chris Stokel-Walker.
Large language models (LLMs) seem to get less reliable at answering simple questions when they get bigger and learn from human feedback. AI developers try to improve the power of LLMs in two main ways: scaling up – giving them more training data and more computational power – and shaping up, or fine-tuning them in response to human feedback.
Los grandes modelos lingüísticos (LLM) parecen ser menos fiables a la hora de responder a preguntas sencillas cuando crecen y aprenden de los comentarios de las personas. Los desarrolladores de IA intentan mejorar la potencia de los LLM de dos formas principales: ampliándolos -dotándolos de más datos de entrenamiento y más potencia de cálculo- y dándoles forma, o afinándolos en respuesta a la retroalimentación humana.
Los modelos de lenguaje grandes (LLM) parecen ser menos confiables para responder preguntas simples cuando crecen y aprenden de la retroalimentación humana. Los desarrolladores de IA intentan mejorar el poder de los LLM de dos maneras principales: ampliándolos, dándoles más datos de entrenamiento y más poder computacional, y dándoles forma o ajustándolos en respuesta a la retroalimentación humana.
José Hernández-Orallo, at the Polytechnic University of Valencia, Spain, and his colleagues examined the performance of LLMs as they scaled up and shaped up. They looked at OpenAI’s GPT series of chatbots, Meta’s LLaMA AI models, and BLOOM, developed by a group of researchers called BigScience.
José Hernández-Orallo, de la Universidad Politécnica de Valencia (España), y sus colegas examinaron el rendimiento de los LLM a medida que se ampliaban y modelaban. Analizaron la serie GPT de chatbots de OpenAI, los modelos de IA LLaMA de Meta y BLOOM, desarrollado por un grupo de investigadores llamado BigScience.
José Hernández-Orallo , de la Universidad Politécnica de Valencia, España, y sus colegas examinaron el desempeño de los LLM a medida que se ampliaban y perfilaban. Analizaron la serie de chatbots GPT de OpenAI, los modelos de IA LLaMA de Meta y BLOOM, desarrollados por un grupo de investigadores llamado BigScience.
The researchers tested the AIs by posing five types of task: arithmetic problems, solving anagrams, geographical questions, scientific challenges and pulling out information from disorganised lists.
Los investigadores probaron las IA planteándoles cinco tipos de tareas: problemas aritméticos, resolución de anagramas, preguntas geográficas, retos científicos y extracción de información de listas desordenadas.
Los investigadores probaron las IA planteando cinco tipos de tareas: problemas aritméticos, resolución de anagramas, preguntas geográficas, desafíos científicos y extracción de información de listas desorganizadas.
They found that scaling up and shaping up can make LLMs better at answering tricky questions, such as rearranging the anagram “yoiirtsrphaepmdhray” into “hyperparathyroidism”. But this isn’t matched by improvement on basic questions, such as “what do you get when you add together 24427 and 7120”, which the LLMs continue to get wrong.
Descubrieron que escalar y dar forma puede hacer que los LLM respondan mejor a preguntas difíciles, como reordenar el anagrama «yoiirtsrphaepmdhray» en «hiperparatiroidismo». Pero esto no se corresponde con una mejora en las preguntas básicas, como «¿qué se obtiene al sumar 24427 y 7120?», en las que los LLM siguen equivocándose.
Descubrieron que la ampliación y la configuración pueden hacer que los LLM respondan mejor a preguntas difíciles, como reorganizar el anagrama "yoiirtsrphaepmdhray" en "hiperparatiroidismo". Pero esto no se corresponde con una mejora en las preguntas básicas, como "¿qué obtienes cuando sumas 24427 y 7120?", que los LLM continúan equivocándose.
While their performance on difficult questions got better, the likelihood that an AI system would avoid answering any one question – because it couldn’t – dropped. As a result, the likelihood of an incorrect answer rose.
Aunque su rendimiento en las preguntas difíciles mejoró, la probabilidad de que un sistema de IA evitara responder a una pregunta concreta -porque no podía- disminuyó. Como resultado, aumentó la probabilidad de una respuesta incorrecta.
Si bien su desempeño en preguntas difíciles mejoró, la probabilidad de que un sistema de IA evitara responder cualquier pregunta, porque no podía, disminuyó. Como resultado, aumentó la probabilidad de una respuesta incorrecta.
Comments:
After taking the article, originally written in English, and then translating it to Spanish using MateCat and DeepL, I came to notice different things:
This time, the differences were more predominant in the translations. In Project 1A, the differences were noticeable but not that frequent. In Project 1B, there were instances where word choice differences were 2 to three times in one sentence, showing a clear difference when translating from Spanish to English and from English to Spanish.
Unlike last time, I didn't have a clear preference for which translation I liked best. In certain instances, DeepL's translation was better and in other instances, MateCat's translation was a better fit.
Determining which translation was better is a bit tough this time, but once again, MateCat is the one I prefer.