¿Qué tan preciso es PFD Bench?

PFD Bench lee un diagrama de flujo de procesos (DXF) y produce una tabla de equipos estructurada (SET): cada unidad, su tipo y cómo está conectada. A partir de esta tabla, genera una descripción escrita del proceso. La calidad de la SET es fundamental para el resultado de la descripción: cometer unos pocos errores críticos en la SET hará que toda la descripción sea incorrecta.

Por esta razón, PFD Bench cuenta con un paso de intervención humana en el bucle justo después de la extracción de SET, para que el usuario tenga la oportunidad de corregir cualquier error cometido por la IA. Además, ejecutamos bucles de evaluación para medir la calidad de la extracción de SET en comparación con tablas de referencia comisariadas por un ingeniero de procesos sénior, en 8 diagramas de flujo de procesos industriales reales. Si bien no podemos compartir los diagramas con el público (están bajo acuerdo de confidencialidad), podemos mostrar los resultados de la evaluación y estadísticas aproximadas sobre la complejidad de cada dibujo.

La evaluación se realiza procesando cada dibujo 10 veces de forma independiente (80 ejecuciones en total) con la misma configuración que tienen todos los usuarios en PFD Bench. Actualmente, los SET se procesan con Google Gemini 2.5 Pro. Las cifras a continuación incluyen la dispersión entre ejecuciones, por lo que se puede ver no solo la calidad de extracción en promedio, sino también su varianza.

Los dibujos

Complejidad en términos sencillos: cuántas unidades de equipo y cuántas conexiones de flujos documentadas hay entre ellas. La densidad (conexiones por unidad) es lo que hace que un plano sea especialmente difícil. Las plantas altamente interconectadas son más difíciles de rastrear que los trenes lineales.

DibujoUnidades de equipoConexiones de transmisiónDensidad
pfd_038202.5
pfd_0420532.6
pfd_0518462.6
pfd_0619482.5
pfd_07331755.3
pfd_08321163.6
pfd_0929692.4
pfd_1028833.0

Resultados

Las puntuaciones son F1 × 100 (véase “Cómo leer estos números” más abajo), una columna por campo de la tabla extraída: media ± desviación estándar en las 10 ejecuciones. Cuanto más cerca de 100, mejor. Cualquier valor superior a 80 ya es una extracción excelente con muy pocos errores.

DibujoEtiquetaTipo de equipoCorrientes de entradaEntrada #Corrientes de salidaToma de corriente #
pfd_0393 ± 890 ± 1496 ± 693 ± 894 ± 793 ± 8
pfd_0496 ± 395 ± 594 ± 395 ± 589 ± 293 ± 5
pfd_0599 ± 398 ± 394 ± 694 ± 392 ± 592 ± 6
pfd_0693 ± 193 ± 192 ± 593 ± 292 ± 690 ± 3
pfd_0799 ± 197 ± 478 ± 983 ± 1778 ± 988 ± 15
pfd_0899 ± 198 ± 276 ± 378 ± 980 ± 388 ± 10
pfd_0990 ± 790 ± 796 ± 588 ± 797 ± 288 ± 7
pfd_1094 ± 592 ± 990 ± 689 ± 785 ± 576 ± 7
Todos los dibujos (agrupados)969586888688

En palabras: la identificación de equipos está esencialmente resuelta. Las etiquetas y los tipos de equipos se sitúan en 95–96% en todo el conjunto, y en los planos limpios, en 98–99%. La representación de la conectividad se ejecuta entre 86 y 901 TP3T en planos típicos.; las plantas más densas y mejor interconectadas (pfd_07, pfd_08) hacen que las columnas de flujo se sitúen en torno a 76–80%. Sigue siendo un resultado muy bueno, pero demuestra que el seguimiento de cada rama de diagramas muy densos exige nuevas mejoras en los modelos y en la forma en que preprocesamos los datos que se proporcionan al LLM.


Cómo leer estos números

Cada puntuación es una Puntuación F1, que es la medida de precisión estándar para tareas de extracción, combinando la precisión y la recuperación en un solo número (100 = perfecto). En nuestro contexto:

  • Verdadero positivo (TP): algo que está en el dibujo, y PFD Bench lo reportó correctamente.
  • Falso negativo (FN): algo en el dibujo que PFD Bench pasó por alto, por ejemplo, una unidad o conexión ausente en su tabla.
  • Falso positivo (FP): algo que PFD Bench informó que es no en el dibujo. Esto también se conoce como “alucinación” en el mundo de los LLM.

Precisión = de todo lo reportado, cuánto fue correcto. Recordar = de todo lo que hay en el dibujo, cuánto fue encontrado.

F1 es su media armónica

F1 = 2 × Precision × Recall / (Precision + Recall)

por lo tanto, un sistema no puede obtener una buena puntuación adivinando cosas o permaneciendo en silencio. Ambos errores son castigados.

Metodología, brevemente

  • Tablas de referencia: contrastado con los dibujos originales. Cuando varias formas de expresión son igualmente correctas (“Dryer” frente a “Drier”, una etiqueta frente a su nombre completo), la equivalencia se adjudicó una vez y se aplicó de manera sistemática a todas las ejecuciones.
  • Puntuación determinista reglas fijas y controladas por versiones; aquí ninguna IA juzga a otra IA. Una salida idéntica siempre produce la puntuación idéntica, reproducible en cualquier punto del historial del proyecto.
  • Todas las respuestas del modelo sin procesar están archivadas: Cualquier número de esta tabla se puede rastrear hasta la salida exacta del modelo que lo produjo.

Última actualización: 2026-08-06

es_ESES