
Quão fiável é o PFD Bench?
O PFD Bench lê um fluxograma de processo (DXF) e produz uma tabela de equipamentos estruturada (SET): cada unidade, o seu tipo e a forma como está ligada. Com base nesta tabela, gera posteriormente uma descrição de processo escrita. A qualidade da SET é crítica para o resultado da descrição: se cometer alguns erros críticos na SET, toda a descrição ficará errada.
Por este motivo, o PFD Bench possui uma etapa de intervenção humana (Human-In-The-Loop) logo após a extração de SET, para que o utilizador tenha a oportunidade de corrigir qualquer erro cometido pela IA. Além disso, executamos ciclos de avaliação para medir a qualidade da extração de SET em comparação com tabelas de referência curadas por um engenheiro de processos sénior, em 8 diagramas de fluxo de processos industriais reais. Embora não possamos partilhar os diagramas com o público (estão sob acordo de confidencialidade), podemos mostrar os resultados da avaliação e estatísticas aproximadas sobre a complexidade de cada desenho.
A avaliação é feita processando cada desenho 10 vezes de forma independente (80 execuções no total) com as mesmas definições que todos os utilizadores têm no PFD Bench. Atualmente, os SETs são processados com o Google Gemini 2.5 Pro. Os números abaixo incluem a dispersão entre execuções, para que se possa ver não só a qualidade média da extração, mas também a sua variância.
Os desenhos
Complexidade em termos simples: quantas unidades de equipamento e quantas ligações de correntes documentadas entre elas. A densidade (ligaçoes por unidade) é o que torna um desenho particularmente difícil. As fábricas altamente interconectadas são mais difíceis de rastrear do que as linhas lineares.
| Desenho | Unidades de equipamento | Ligações de fluxo | Densidade |
|---|---|---|---|
| pfd_03 | 8 | 20 | 2.5 |
| pfd_04 | 20 | 53 | 2.6 |
| pfd_05 | 18 | 46 | 2.6 |
| pfd_06 | 19 | 48 | 2.5 |
| pfd_07 | 33 | 175 | 5.3 |
| pfd_08 | 32 | 116 | 3.6 |
| pfd_09 | 29 | 69 | 2.4 |
| pfd_10 | 28 | 83 | 3.0 |
Resultados
As pontuações são F1 × 100 (ver “Como ler estes números” abaixo), uma coluna por campo da tabela extraída: média ± desvio padrão ao longo das 10 execuções. Quanto mais perto de 100, melhor. Qualquer valor acima de 80 já é uma extração excelente com muito poucos erros.
| Desenho | Etiqueta | Tipo de equipamento | Cursos de água de alimentação | Entrada # | Fluxos de saída | Tomada # |
|---|---|---|---|---|---|---|
| pfd_03 | 93 ± 8 | 90 ± 14 | 96 ± 6 | 93 ± 8 | 94 ± 7 | 93 ± 8 |
| pfd_04 | 96 ± 3 | 95 ± 5 | 94 ± 3 | 95 ± 5 | 89 ± 2 | 93 ± 5 |
| pfd_05 | 99 ± 3 | 98 ± 3 | 94 ± 6 | 94 ± 3 | 92 ± 5 | 92 ± 6 |
| pfd_06 | 93 ± 1 | 93 ± 1 | 92 ± 5 | 93 ± 2 | 92 ± 6 | 90 ± 3 |
| pfd_07 | 99 ± 1 | 97 ± 4 | 78 ± 9 | 83 ± 17 | 78 ± 9 | 88 ± 15 |
| pfd_08 | 99 ± 1 | 98 ± 2 | 76 ± 3 | 78 ± 9 | 80 ± 3 | 88 ± 10 |
| pfd_09 | 90 ± 7 | 90 ± 7 | 96 ± 5 | 88 ± 7 | 97 ± 2 | 88 ± 7 |
| pfd_10 | 94 ± 5 | 92 ± 9 | 90 ± 6 | 89 ± 7 | 85 ± 5 | 76 ± 7 |
| Todos os desenhos (reunidos) | 96 | 95 | 86 | 88 | 86 | 88 |
Por extenso: a identificação de equipamento está essencialmente resolvida. As etiquetas e os tipos de equipamento aparecem em 95–96% em todo o conjunto e, nos desenhos limpos, em 98–99%. O mapeamento de conectividade é executado em 86–90% em desenhos típicos; as plantas mais densas e interligadas (pfd_07, pfd_08) direcionam as colunas de fluxo para 76–80%. Continua a ser um resultado muito bom, mas demonstra que o rastreio de todos os ramos de diagramas altamente densos exige melhorias adicionais nos modelos e na forma como pré-processamos os dados fornecidos ao LLM.
Como ler estes números
Cada pontuação é um F1 score, que é a medida de precisão padrão para tarefas de extracção, combinando a precisão e a revocação num único número (100 = perfeito). No nosso contexto:
- Verdadeiro positivo (TP): algo que está no desenho e o PFD Bench relatou corretamente.
- Falso negativo (FN): algo no desenho que a PFD Bench omitiu, por exemplo, uma unidade ou ligação ausente da respetiva tabela.
- Falso positivo (FP): algo relatado pelo PFD Bench que é não no desenho. Isto também é conhecido como “alucinação” no mundo dos LLM.
Precisão = de tudo o que foi reportado, quanto é que certo. Recordar = de tudo no desenho, quanto é que foi encontrado.
O F1 é a respetiva média harmónica
F1 = 2 × Precisão × Revocação / (Precisão + Revocação)
por isso, um sistema não consegue pontuar bem adivinhando coisas ou ficando em silêncio. Ambos os erros são punidos.
Metodologia, brevemente
- Tabelas de referência: verificado face aos desenhos originais. Onde várias formulações são igualmente corretas (“Dryer” vs “Drier”, uma etiqueta versus o respetivo nome completo), a equivalência foi decidida uma vez e aplicada de forma consistente a cada execução.
- Pontuação determinística: regras fixas e controladas por versão; nenhuma IA julga outra IA aqui. Uma saída idêntica produz sempre a mesma pontuação, reprodutível em qualquer ponto do histórico do projeto.
- Todas as respostas brutas do modelo são arquivadas: qualquer número nesta tabela pode ser rastreado até à saída exata do modelo que o produziu.
Última atualização: 2026-08-06
