Avaliações de referência

Reprodutibilidade e ciência aberta.

Avaliações de referência

A avaliação do modelo AMALIA seguiu o estado da arte das metodologias de avaliação de LLMs e incluiu vários ambientes de avaliação de referência, criados e utilizados por equipas criadoras de LLMs. Estes ambientes de avaliação foram traduzidos para português europeu e nas áreas necessárias foram criados novos ambientes de avaliação. Os modelos criados foram avaliados num total de 45 ambientes de avaliação.

Todos os ambientes de avaliação estão integrados na plataforma de avaliação lm-evaluation-harness, desenvolvida pela EleutherAI e referência padrão na avaliação de modelos de linguagem de larga escala.

As secções seguintes apresentam os detalhes da avaliação do modelo nos vários ambientes de avaliação.

Ambientes de avaliação padronizados

O modelo AMALIA foi avaliado num conjunto de 34 ambientes de avaliação padronizados para aferir o desempenho das diferentes capacidades dos modelos de linguagem da família AMALIA.

Novos ambientes de avaliação

Para assegurar uma maior cobertura da avaliação das capacidades dos modelos AMALIA, foram criados novos ambientes de avaliação para melhor aferir o desempenho do modelo. Estes ambientes de avaliação visam aferir a capacidade de LLMs em português europeu em tarefas que vão desde a linguística, passando pela cultura, até à discussão de temas sensíveis.

Deste modo, o projeto AMALIA contribui de forma marcante para a comunidade com um conjunto extenso de avaliações de LLMs para pt-PT. Esta divulgação permitirá à comunidade tirar partido do trabalho de investigação realizado e agilizar o ciclo de investigação e desenvolvimento de LLMs para pt-PT.