
Quão fiável é o PFD Bench?
O PFD Bench lê um fluxograma de processo (DXF) e produz uma tabela de equipamentos estruturada (SET): cada unidade, o seu tipo e a forma como está ligada. Com base nesta tabela, gera posteriormente uma descrição de processo escrita. A qualidade da SET é crítica para o resultado da descrição: se cometer alguns erros críticos na SET, toda a descrição ficará errada.
Por este motivo, o PFD Bench possui uma etapa de intervenção humana (Human-In-The-Loop) logo após a extração de SET, para que o utilizador tenha a oportunidade de corrigir qualquer erro cometido pela IA. Além disso, executamos ciclos de avaliação para medir a qualidade da extração de SET em comparação com tabelas de referência curadas por um engenheiro de processos sénior, em 8 diagramas de fluxo de processos industriais reais. Embora não possamos partilhar os diagramas com o público (estão sob acordo de confidencialidade), podemos mostrar os resultados da avaliação e estatísticas aproximadas sobre a complexidade de cada desenho.
A avaliação é feita processando cada desenho 10 vezes de forma independente (80 execuções no total) com as mesmas definições que todos os utilizadores têm no PFD Bench. Atualmente, os SETs são processados com o Google Gemini 2.5 Pro. Os números abaixo incluem a dispersão entre execuções, para que se possa ver não só a qualidade média da extração, mas também a sua variância.
Os desenhos
Complexidade em termos simples: quantas unidades de equipamento e quantas ligações de correntes documentadas entre elas. A densidade (ligaçoes por unidade) é o que torna um desenho particularmente difícil. As fábricas altamente interconectadas são mais difíceis de rastrear do que as linhas lineares.
| Desenho | Unidades de equipamento | Ligações de fluxo | Densidade |
|---|---|---|---|
| pfd_03 | 8 | 20 | 2.5 |
| pfd_04 | 20 | 53 | 2.6 |
| pfd_05 | 18 | 46 | 2.6 |
| pfd_06 | 19 | 48 | 2.5 |
| pfd_07 | 33 | 175 | 5.3 |
| pfd_08 | 32 | 116 | 3.6 |
| pfd_09 | 29 | 69 | 2.4 |
| pfd_10 | 28 | 83 | 3.0 |
Resultados
As pontuações são F1 × 100 (see “How to read these numbers” below), one column per field of the extracted table: mean ± standard deviation over the 10 runs. The closer to 100, the better. Anything above 80 is already an excellent extraction with very few errors.
| Desenho | Etiqueta | Tipo de equipamento | Cursos de água de alimentação | Entrada # | Fluxos de saída | Tomada # |
|---|---|---|---|---|---|---|
| pfd_03 | 93 ± 8 | 90 ± 14 | 96 ± 6 | 93 ± 8 | 94 ± 7 | 93 ± 8 |
| pfd_04 | 96 ± 3 | 95 ± 5 | 94 ± 3 | 95 ± 5 | 89 ± 2 | 93 ± 5 |
| pfd_05 | 99 ± 3 | 98 ± 3 | 94 ± 6 | 94 ± 3 | 92 ± 5 | 92 ± 6 |
| pfd_06 | 93 ± 1 | 93 ± 1 | 92 ± 5 | 93 ± 2 | 92 ± 6 | 90 ± 3 |
| pfd_07 | 99 ± 1 | 97 ± 4 | 78 ± 9 | 83 ± 17 | 78 ± 9 | 88 ± 15 |
| pfd_08 | 99 ± 1 | 98 ± 2 | 76 ± 3 | 78 ± 9 | 80 ± 3 | 88 ± 10 |
| pfd_09 | 90 ± 7 | 90 ± 7 | 96 ± 5 | 88 ± 7 | 97 ± 2 | 88 ± 7 |
| pfd_10 | 94 ± 5 | 92 ± 9 | 90 ± 6 | 89 ± 7 | 85 ± 5 | 76 ± 7 |
| Todos os desenhos (reunidos) | 96 | 95 | 86 | 88 | 86 | 88 |
Por extenso: a identificação de equipamento está essencialmente resolvida. Equipment tags and types land at 95–96% across the set, and on clean drawings at 98–99%. Connectivity mapping runs at 86–90% on typical drawings; the densest, most interconnected plants (pfd_07, pfd_08) pull the stream columns toward 76–80%. Still very good, but it shows that tracing every branch of highly dense diagrams demands further improvements to the models and to how we pre-process the data the LLM is served.
Como ler estes números
Cada pontuação é um F1 score, que é a medida de precisão padrão para tarefas de extracção, combinando a precisão e a revocação num único número (100 = perfeito). No nosso contexto:
- Verdadeiro positivo (TP): algo que está no desenho e o PFD Bench relatou corretamente.
- Falso negativo (FN): algo no desenho que a PFD Bench omitiu, por exemplo, uma unidade ou ligação ausente da respetiva tabela.
- Falso positivo (FP): algo relatado pelo PFD Bench que é não on the drawing. This is also known as “hallucination” in the LLM world.
Precisão = de tudo o que foi reportado, quanto é que certo. Recordar = de tudo no desenho, quanto é que foi encontrado.
O F1 é a respetiva média harmónica
F1 = 2 × Precision × Recall / (Precision + Recall)
por isso, um sistema não consegue pontuar bem adivinhando coisas ou ficando em silêncio. Ambos os erros são punidos.
Metodologia, brevemente
- Tabelas de referência: curated against the original drawings. Where several phrasings are equally correct (“Dryer” vs “Drier”, a tag vs its full name), the equivalence was adjudicated once, and applied consistently to every run.
- Pontuação determinística: regras fixas e controladas por versão; nenhuma IA julga outra IA aqui. Uma saída idêntica produz sempre a mesma pontuação, reprodutível em qualquer ponto do histórico do projeto.
- Todas as respostas brutas do modelo são arquivadas: qualquer número nesta tabela pode ser rastreado até à saída exata do modelo que o produziu.
Última atualização: 2026-08-06
