¿Qué tan preciso es PFD Bench?

PFD Bench lee un diagrama de flujo de procesos (DXF) y produce una tabla de equipos estructurada (SET): cada unidad, su tipo y cómo está conectada. A partir de esta tabla, genera una descripción escrita del proceso. La calidad de la SET es fundamental para el resultado de la descripción: cometer unos pocos errores críticos en la SET hará que toda la descripción sea incorrecta.

Por esta razón, PFD Bench cuenta con un paso de intervención humana en el bucle justo después de la extracción de SET, para que el usuario tenga la oportunidad de corregir cualquier error cometido por la IA. Además, ejecutamos bucles de evaluación para medir la calidad de la extracción de SET en comparación con tablas de referencia comisariadas por un ingeniero de procesos sénior, en 8 diagramas de flujo de procesos industriales reales. Si bien no podemos compartir los diagramas con el público (están bajo acuerdo de confidencialidad), podemos mostrar los resultados de la evaluación y estadísticas aproximadas sobre la complejidad de cada dibujo.

La evaluación se realiza procesando cada dibujo 10 veces de forma independiente (80 ejecuciones en total) con la misma configuración que tienen todos los usuarios en PFD Bench. Actualmente, los SET se procesan con Google Gemini 2.5 Pro. Las cifras a continuación incluyen la dispersión entre ejecuciones, por lo que se puede ver no solo la calidad de extracción en promedio, sino también su varianza.

Los dibujos

Complejidad en términos sencillos: cuántas unidades de equipo y cuántas conexiones de flujos documentadas hay entre ellas. La densidad (conexiones por unidad) es lo que hace que un plano sea especialmente difícil. Las plantas altamente interconectadas son más difíciles de rastrear que los trenes lineales.

DibujoUnidades de equipoConexiones de transmisiónDensidad
pfd_038202.5
pfd_0420532.6
pfd_0518462.6
pfd_0619482.5
pfd_07331755.3
pfd_08321163.6
pfd_0929692.4
pfd_1028833.0

Resultados

Las puntuaciones son F1 × 100 (see “How to read these numbers” below), one column per field of the extracted table: mean ± standard deviation over the 10 runs. The closer to 100, the better. Anything above 80 is already an excellent extraction with very few errors.

DibujoEtiquetaTipo de equipoCorrientes de entradaEntrada #Corrientes de salidaToma de corriente #
pfd_0393 ± 890 ± 1496 ± 693 ± 894 ± 793 ± 8
pfd_0496 ± 395 ± 594 ± 395 ± 589 ± 293 ± 5
pfd_0599 ± 398 ± 394 ± 694 ± 392 ± 592 ± 6
pfd_0693 ± 193 ± 192 ± 593 ± 292 ± 690 ± 3
pfd_0799 ± 197 ± 478 ± 983 ± 1778 ± 988 ± 15
pfd_0899 ± 198 ± 276 ± 378 ± 980 ± 388 ± 10
pfd_0990 ± 790 ± 796 ± 588 ± 797 ± 288 ± 7
pfd_1094 ± 592 ± 990 ± 689 ± 785 ± 576 ± 7
Todos los dibujos (agrupados)969586888688

En palabras: la identificación de equipos está esencialmente resuelta. Equipment tags and types land at 95–96% across the set, and on clean drawings at 98–99%. Connectivity mapping runs at 86–90% on typical drawings; the densest, most interconnected plants (pfd_07, pfd_08) pull the stream columns toward 76–80%. Still very good, but it shows that tracing every branch of highly dense diagrams demands further improvements to the models and to how we pre-process the data the LLM is served.


Cómo leer estos números

Cada puntuación es una Puntuación F1, que es la medida de precisión estándar para tareas de extracción, combinando la precisión y la recuperación en un solo número (100 = perfecto). En nuestro contexto:

  • Verdadero positivo (TP): algo que está en el dibujo, y PFD Bench lo reportó correctamente.
  • Falso negativo (FN): algo en el dibujo que PFD Bench pasó por alto, por ejemplo, una unidad o conexión ausente en su tabla.
  • Falso positivo (FP): algo que PFD Bench informó que es no on the drawing. This is also known as “hallucination” in the LLM world.

Precisión = de todo lo reportado, cuánto fue correcto. Recordar = de todo lo que hay en el dibujo, cuánto fue encontrado.

F1 es su media armónica

F1 = 2 × Precision × Recall / (Precision + Recall)

por lo tanto, un sistema no puede obtener una buena puntuación adivinando cosas o permaneciendo en silencio. Ambos errores son castigados.

Metodología, brevemente

  • Tablas de referencia: curated against the original drawings. Where several phrasings are equally correct (“Dryer” vs “Drier”, a tag vs its full name), the equivalence was adjudicated once, and applied consistently to every run.
  • Puntuación determinista reglas fijas y controladas por versiones; aquí ninguna IA juzga a otra IA. Una salida idéntica siempre produce la puntuación idéntica, reproducible en cualquier punto del historial del proyecto.
  • Todas las respuestas del modelo sin procesar están archivadas: Cualquier número de esta tabla se puede rastrear hasta la salida exacta del modelo que lo produjo.

Última actualización: 2026-08-06

es_ESES