No que pesquisamos.

Seis linhas de pesquisa, uma pergunta de fundo em todas: como sabemos que esse sistema é confiável? Aqui você encontra o recorte de cada frente — perguntas, métodos, subtemas e trabalhos recentes.

IA confiável

Trustworthy AI

"Como sabemos que esse modelo é confiável — antes que alguém precise confiar nele?"

É a linha-chassi do laboratório: estudamos as condições sob as quais um modelo de aprendizado pode ser usado em decisões reais. Isso envolve quantificar incerteza, auditar comportamento contra especificação, calibrar probabilidades e expor as falhas modo-de-falha que um modelo "100% de acurácia" esconde.

Trabalhamos junto às outras cinco linhas — robustez, fairness, modelos de linguagem, recomendação, sistemas inteligentes — porque confiabilidade não é uma camada que se aplica depois, é uma propriedade que precisa entrar no projeto.

Métodos Conformal prediction Calibration metrics (ECE, MCE) Audit harnesses Bayesian deep learning Selective prediction
01.a Calibration Probabilidades que correspondem a frequências reais — temperatura, isotônica, conformal.
01.b Auditing Protocolos para verificar comportamento de modelos em produção contra requisitos.
01.c Uncertainty Quantificação epistêmica e aleatória — abstenção, deferência, decisão sob risco.
Trabalhos recentes
  • 2026 Calibração leve pós-treino para LLMs em português NeurIPS
  • 2025 Auditoria de classificadores de crédito sob shift demográfico FAccT
  • 2025 Predição conformal para recomendação top-k RecSys
Robustez de modelos

Robustness

"O treino terminou — agora o mundo muda. O modelo aguenta?"

Modelos saem do laboratório com acurácia ótima, e quebram em produção por motivos banais: distribuições que mudam, dados manipulados de propósito, fronteiras de decisão frágeis. Estudamos como medir, garantir e recuperar robustez sob essas pressões reais.

O recorte vai de distribution shift em séries temporais e tabular até perturbações adversariais em modelos de linguagem e visão, com foco em quando a robustez vale o trade-off com acurácia limpa.

Métodos Adversarial training Distributionally robust optimization Domain adaptation Test-time augmentation Certified defenses
02.a OOD & distribution shift Detecção e adaptação quando o dado de produção sai da distribuição de treino.
02.b Adversarial robustness Defesas e auditoria contra perturbações maliciosas em visão, NLP e recomendação.
Trabalhos recentes
  • 2026 Robustez certificada para recomendadores sob ataque por injeção KDD
  • 2025 Detecção de OOD para classificação clínica em dados brasileiros BRACIS
Sistemas de recomendação

Recommender Systems

"Como recomendar quando ninguém escolheu nada — e como medir se a recomendação serviu?"

Linha histórica do laboratório, com forte tradição metodológica. Trabalhamos os dois extremos do problema: cold start (usuário novo, item novo, domínio novo) e diversidade (quando um catálogo gigante converge para os mesmos cinco itens).

Cruza com fairness — recomendar de forma justa para produtores e consumidores — e com robustez — recomendar sob ataque de injeção e feedback loop. Aplicações em educação personalizada, varejo e mídia.

Métodos Matrix & tensor factorization Sequential / session-based Graph neural networks Contextual bandits Counterfactual evaluation
03.a Diversity Promover diversidade sem destruir acurácia: medir, otimizar e auditar trade-off.
03.b Cold start Recomendação para usuários, itens e domínios sem histórico — meta-learning, side info, hybrid models.
Trabalhos recentes
  • 2026 Recomendação educacional em larga escala com sinais fracos WSDM
  • 2025 Diversidade calibrada para catálogos longos RecSys
  • 2025 Avaliação contrafactual de recomendadores em produção KDD
Justiça algorítmica

Fairness

"O que é uma decisão algorítmica justa — e como auditá-la antes que ela vire política?"

Investigamos justiça algorítmica como uma propriedade que precisa ser definida, mensurável e auditável, não como um adjetivo. Operamos em duas frentes complementares: paridade de grupos (a foto agregada do sistema) e contrafactuais (o que mudaria para esse indivíduo).

Trabalhamos em domínios sensíveis — crédito, saúde, educação, plataformas — sempre com a pergunta: essa métrica de justiça reflete o dano real que tentamos evitar?

Métodos Group fairness metrics Causal & counterfactual inference In-processing constraints Post-processing reweighing Disaggregated evaluation
04.a Group parity Demographic parity, equalized odds, equal opportunity — quando aplicar cada uma.
04.b Counterfactual fairness Justiça do ponto de vista individual com modelos causais — o que mudaria, e para quem.
Trabalhos recentes
  • 2026 Justiça em sistemas de recomendação: tese de doutorado PESC/COPPE
  • 2025 Reweighing contrafactual para classificadores de crédito FAccT
Sistemas inteligentes

Intelligent Systems

"Quando aprendizado puro não basta — e quando otimização clássica precisa de aprendizado para escalar."

Linha-ponte do laboratório: aqui aprendizado de máquina encontra otimização combinatória, busca em grafos, simulação e métodos clássicos de IA. Construímos sistemas híbridos onde cada componente está no lugar certo — neural onde resolve, simbólico onde precisa.

Aplicações em problemas de planejamento, logística, alocação de recursos e simulação de domínios complexos, em colaboração com setores público e privado.

Métodos Combinatorial optimization Metaheuristics Reinforcement learning Neuro-symbolic Simulation-based learning
05.a Optimization Métodos exatos, heurísticos e aprendidos para problemas combinatórios e contínuos.
05.b Hybrid models Neural + simbólico, neural + simulador, neural + solver — onde compõe e onde quebra.
Trabalhos recentes
  • 2025 Aprendizado de heurísticas para roteamento sob restrições reais ENIAC
  • 2025 Modelos neuro-simbólicos para diagnóstico em séries longas BRACIS
Modelos de linguagem

Language Models

"Modelos de linguagem que entendem o Brasil — e que sabem quando não sabem."

Investigamos LLMs com três compromissos: qualidade real em português brasileiro, recuperação aumentada (não inventar quando dá pra consultar) e alinhamento ao que faz sentido no contexto sociotécnico brasileiro.

Construímos benchmarks, fazemos avaliação humana e automática, e estudamos onde a calibração da linha 01 e a robustez da linha 02 entram em modelos generativos — porque um modelo de linguagem que decide é um modelo de linguagem que precisa ser auditado.

Métodos Instruction tuning RAG (retrieval-augmented gen.) Preference optimization (DPO) LLM-as-judge eval PT-BR benchmark design
06.a PT-BR evaluation Benchmarks, métricas e protocolos próprios para LLMs em português brasileiro.
06.b Retrieval-augmented gen. RAG sob consulta a fontes oficiais brasileiras — legislação, dados públicos, conhecimento de domínio.
06.c Alignment Alinhamento ao contexto local — não importado de pipelines em inglês.
Trabalhos recentes
  • 2026 Quatro benchmarks brasileiros para avaliação de LLMs ACL
  • 2026 RAG sobre legislação federal brasileira NeurIPS
  • 2025 Avaliação humana de assistentes em PT-BR — protocolo aberto arXiv
Como pesquisamos

Princípios que atravessam as seis linhas.

01 · Aberto

Ciência aberta por padrão

Pré-prints em arXiv, código em repositórios públicos, benchmarks reproduzíveis. Resultado que ninguém pode auditar não conta.

02 · Ancorado

Problema brasileiro, método de fronteira

Não importamos pipeline em inglês e renomeamos. Construímos benchmarks, datasets e protocolos para o contexto local.

03 · Atravessado

As seis linhas se conversam

Calibração que aparece em LLMs. Justiça que aparece em recomendação. Robustez que aparece em sistemas inteligentes. Não são silos.

04 · Formado

Pesquisa que forma pesquisadores

Cada linha tem mestrandos e doutorandos do PESC/COPPE conduzindo a investigação — não auxiliares, mas autores.