
Tem perguntas?
Nós respondemos.
O que é um LLM?
Um LLM (Large Language Model) é um modelo que emprega Inteligência Artificial (IA) para processar, compreender e gerar texto em linguagem natural. Pode ser utilizado como um componente em vários tipos de sistemas, tais como sistemas de diálogo e chatbots, sistemas de pesquisa, sistemas automáticos de resposta a perguntas, entre outros.
O LLM português será equivalente ao ChatGPT?
Não. O ChatGPT é, antes de mais, uma aplicação sobre um LLM (tipicamente uma das versões da família GPT) desenvolvida pela OpenAI. Portanto, não devemos comparar diretamente o ChatGPT (uma aplicação) com o AMALIA (um LLM). Além disso, os modelos da família GPT são fechados, desenvolvidos internamente pela OpenAI e têm como objetivo responder a questões genéricas. Portanto, não são conhecidas as características técnicas do LLM nem o conjunto de dados em que foi treinado. Em contraste, o LLM português é um modelo aberto, disponibilizado publicamente, com um model card associado (contendo informação sobre as características do modelo e os dados em que foi treinado). Assim, toda a comunidade poderá usufruir e contribuir para melhorar o modelo no futuro.
Porque é importante ter um LLM português?
Com o AMALIA, o sistema de Investigação e Inovação nacional atingiu uma meta importante: conseguiu criar um LLM de forma completamente soberana, desenvolvido 100% na Europa e com foco em Português Europeu. Desta forma foram mitigadas dependências estratégicas ao nível do desenvolvimento de IA generativa.
Quem é a equipa de desenvolvimento?
A equipa é composta pela Universidade NOVA de Lisboa, pelo Instituto Superior Técnico, pela Universidade de Coimbra, pela Universidade do Porto, pela Universidade do Minho e pela Fundação para a Ciência e Tecnologia (Arquivo.PT). Atualmente, estão envolvidas cerca de 30 pessoas no desenvolvimento do modelo de base. Nos domínios específicos estão envolvidas cerca de mais 30 pessoas. Os perfis dos membros da equipa variam desde professores e investigadores seniores até investigadores juniores.
O desenvolvimento de um projeto como o AMALIA exclusivamente por entidades públicas e centros de investigação nacionais demonstra o talento existente em Portugal nas áreas ligadas à inteligência artificial. Este projeto representa uma oportunidade estratégica para explorar e articular competências nacionais, criando sinergias entre instituições com mérito científico e tecnológico reconhecido internacionalmente. A criação de um modelo de linguagem de grande escala (ou LLM) com base nacional é possível graças à colaboração entre entidades que se destacam no panorama internacional, tanto pela sua investigação como pela capacidade de inovação. Este esforço conjunto contribui para reforçar a autonomia estratégica de Portugal e reduzir a dependência de soluções tecnológicas estrangeiras em domínios críticos.
Qual a infraestrutura tecnológica?
Para levar a cabo o treino dos modelos, estamos a recorrer a infraestrutura computacional em grande escala, utilizando-se para o efeito supercomputadores nacionais (Mare Nostrum 5, Deucalion) e infraestrutura europeia (EuroHPC), que são também projetos financiados pelo governo português.
Qual o volume de dados/parâmetros que será utilizado para treinar o modelo?
Na primeira fase, o modelo foi desenvolvido com cerca de 9 mil milhões de parâmetros (billions) pré-treinado em 4 biliões de palavras (trillions) e afinado num conjunto de dados em português extraídos e filtrados a partir do Arquivo.PT. Para o efeito, serão combinados dois modelos base já desenvolvidos pela equipa do projeto, o EuroLLM e o GlorIA. Numa segunda fase de desenvolvimento, o modelo será expandido para incluir outras modalidades além de texto e serão utilizadas mais fontes de dados.
Será possível treinar o modelo para evitar potenciais enviesamentos?
Sim. Estão a ser utilizadas técnicas de alinhamento para reduzir potenciais enviesamentos e evitar que o modelo apresente conteúdos perigosos. No entanto, é importante realçar que o sistema poderá apresentar por vezes respostas incorretas às questões apresentadas, como acontece com qualquer LLM, pelo que deverá haver um disclaimer de que as respostas são geradas a partir de um sistema de inteligência artificial e não por um ser humano.
Como será possível assegurar a propriedade intelectual dos conteúdos?
Durante o pré-treino foram utilizados dados abertos, maioritariamente da web, de redes sociais, e também conteúdos com maior qualidade linguística. Sendo um projeto público, desenvolvido em ambiente de investigação e seguindo um modelo de código aberto, os trabalhos de desenvolvimento, tal como têm sido realizados, encontram-se ao abrigo da legislação em vigor. Realça-se que este desenvolvimento tem respeitado os direitos de autor dos dados utilizados para o treino do modelo; ou seja, dados que referem explicitamente que não devem ser utilizados para desenvolvimento técnico-científico foram excluídos do treino. Há, também, um trabalho que está a ser continuamente desenvolvido a nível legal, para assegurar este respeito pelos autores e pela sua propriedade.
Qual a cronologia de implementação?
O projeto tem um tempo total de execução de 18 meses. Numa primeira fase procedeu-se ao treino do modelo com dados em português, tendo sido disponibilizada internamente, para testes e desenvolvimento, uma versão beta em abril de 2025. Este modelo está em evolução constante, a ser continuamente protegido com guardrails e técnicas de segurança, para ser depois gradualmente disponibilizado em serviços selecionados pelo governo. Em setembro de 2025, foi disponibilizada uma versão em desenvolvimento do modelo, baseada numa plataforma para investigadores, professores e alunos universitários portugueses – a IAedu – via uma API. A disponibilização desta versão, numa plataforma de investigação, é de grande importância, uma vez que vai permitir o desenvolvimento do modelo com uma participação e interação cada vez mais próximas da utilização real – são encorajados comentários, sugestões ou outros tipos de contributos que possam ajudar na melhoria do modelo. Numa segunda fase, proceder-se-á à criação de um modelo multimodal capaz de processar também imagens, com finalização prevista no primeiro semestre de 2026.
Como será assegurado o alinhamento com o contexto regulatório do AI Act? Na escala de risco do AI Act, qual será o potencial risco deste modelo?
No âmbito do EU AI Act, o modelo é considerado como General Purpose AI sem risco sistémico. O risco estará associado aos domínios onde for aplicado, sendo assumido pelos respetivos utilizadores ou fornecedores.
Quais os impactos diretos na sociedade?
Estamos a viver um ponto de viragem nas sociedades modernas. Tal como a web em meados da década de 1990, a IA generativa está a transformar todas as sociedades. É importante posicionar Portugal na vanguarda da inovação e da transformação digital que se apresenta como uma oportunidade ímpar para o país. Portugal tem investido em redes de investigação de excelência que estão a dar frutos e que devem continuar a ser alargadas. Portugal pode tornar-se um importante hub internacional na área, tirando partido das várias vantagens estratégicas do país. Por isso, o LLM português contribuirá diretamente para a construção de um ecossistema científico e tecnológico na área de IA generativa em Portugal, que se traduzirá em avanços científicos e com impacto económico. Ao mesmo tempo, sendo disponibilizado de forma aberta, permitirá aos cidadãos, empresas e administração pública o desenvolvimento de soluções de IA em português de Portugal, com um nível superior ao de outros modelos.
Como pode o cidadão, as empresas, a administração pública e a academia aceder ao LLM?
O LLM português será disponibilizado num repositório público como um modelo aberto, podendo ser acedido, utilizado e melhorado por qualquer pessoa ou entidade.
Porque é que um modelo de linguagem do tipo do AMALIA é importante para Portugal e para a economia?
O AMALIA representa um passo importante na capacitação nacional na área de IA. É importante que Portugal tenha instituições que criem ecossistemas de conhecimento, talento e inovação científica para liderar os avanços realizados na área. Atualmente, os novos modelos de IA estão a transformar várias áreas da sociedade e representam um desafio e uma oportunidade para Portugal e para a Europa. A Europa e Portugal devem liderar esta revolução tecnológica, estando já em curso várias iniciativas na Europa para desenvolver LLMs soberanos. Alguns dos exemplos são: Espanha (ALIA, Salamandra); Alemanha (OpenGPT-X, Teuken); Polónia (pllum); Holanda (GPT-NL); Dinamarca (Munin); Suíça (Apertus).
Quais os casos práticos onde o LLM nacional pode ser utilizado? No futuro, onde podemos utilizar o LLM nacional?
O objetivo do AMALIA passa pela melhoria da posição da língua portuguesa no ecossistema global de inteligência artificial. Os casos de uso iniciais irão focar-se nas áreas da educação, história, cultura e administração pública. No entanto, o modelo será disponibilizado de forma aberta, pelo que poderá ser utilizado e melhorado por cientistas e equipas de desenvolvimento em qualquer plataforma.
Qual o modelo de evolução e manutenção previsto, após a conclusão do projeto? É possível estimar um custo?
O projeto seguirá uma política de código e dados abertos. Deste modo, qualquer entidade poderá replicar ou criar livremente derivações do modelo. A evolução e a manutenção do modelo estarão sempre associadas à escala dos dados, à dimensão do modelo e às tarefas de treino. Os custos de manutenção dependerão destes fatores.
Atualmente, quais são as capacidades do modelo AMALIA e quais as suas características principais?
O modelo foi treinado em dados de língua portuguesa e tem capacidade para responder a perguntas e conversar sobre diversos temas, gerar código, explicar conceitos, sumarizar textos, etc. O modelo tem também conhecimento geral sobre a cultura portuguesa. Serão realizadas regularmente tarefas de benchmarking comparativamente com outros modelos públicos com o objetivo de que o modelo melhore o seu desempenho progressivamente.
Está previsto no roadmap o desenvolvimento de alguma interface que permita ao cidadão comum interagir diretamente com o AMALIA?
Está previsto que o AMALIA sirva de suporte a várias aplicações da administração pública. O portal gov.pt será um dos seus primeiros casos de uso. Embora seja possível do ponto de vista da engenharia criar uma aplicação generalista do tipo chatbot, desenvolver uma aplicação concorrente dos chatbots generalistas disponíveis comercialmente não é objetivo do projeto AMALIA.