PHITSBench: AI Benchmark for Radiation Transport Simulation

PHITSBench evaluates AI-generated radiation transport simulations. Knowledge bases improve success from 0% to 57%, showing the importance of domain data.

martes, 28 de julio de 2026 • 5 min read • Q2BSTUDIO Team

Evaluación de la IA en la generación de entradas PHITS

La simulación de transporte de radiación es una herramienta fundamental en campos como la física médica, la protección radiológica, la dosimetría y el diseño de reactores nucleares. Sistemas como PHITS (Particle and Heavy Ion Transport code System) permiten modelar la interacción de partículas con la materia con una precisión que resulta crítica tanto para la investigación como para la industria. Sin embargo, la complejidad de estos códigos —con decenas de parámetros, sintaxis especializada y dependencias físicas— convierte su uso en un desafío incluso para expertos. En este contexto, la inteligencia artificial se perfila como una palanca clave para automatizar tareas repetitivas, detectar errores de configuración y, en última instancia, acelerar el ciclo de simulación.

Recientemente ha sido introducido PHITSBench, un benchmark diseñado específicamente para evaluar la capacidad de los modelos de lenguaje grandes (LLMs) en la generación y modificación de simulaciones con PHITS. Este benchmark consta de 282 tareas distribuidas en tres categorías: edición de parámetros (Edit), reparación de sintaxis (Repair) y generación completa de simulaciones a partir de descripciones en lenguaje natural (Reproduce). Cada tarea se puntúa mediante un Composite Metric Score que combina la ejecución exitosa del código generado con la concordancia entre los observables de transporte producidos y los esperados. Los resultados iniciales, obtenidos con configuraciones del modelo GPT-5.4, muestran un panorama revelador: sin conocimiento específico del dominio, el modelo alcanza un 95% de éxito en tareas de edición y un 70% en reparación, pero no consigue generar simulaciones correctas desde cero en la categoría Reproduce. Este dato subraya una brecha crítica entre la capacidad lingüística de los LLMs y su comprensión real de sistemas físico-técnicos complejos.

Para salvar ese abismo, los investigadores complementaron el modelo con un catálogo estructurado de conocimiento de PHITS en formato legible por máquina, junto con el manual de usuario. Esta inyección de conocimiento elevó el éxito en la categoría Reproduce al 57% en un único intento. Incorporando un flujo de trabajo agéntico —donde el modelo puede iterar, ejecutar y corregir su código— se alcanzó un 66-73% de éxito, aunque a costa de un mayor coste computacional. El análisis de fallos reveló que la mayoría de los errores persistentes no provienen de la sintaxis, sino de una selección incorrecta de observables físicos y su configuración. Es decir, el problema no es escribir código válido, sino entender qué medir y cómo definirlo correctamente.

Estos hallazgos tienen implicaciones profundas para el futuro de la inteligencia artificial aplicada a la ingeniería y la ciencia. La capacidad de un modelo para generar código sintácticamente correcto es solo una parte del rompecabezas. La verdadera inteligencia en este dominio requiere bases de conocimiento estructuradas y accesibles, conjuntos de datos de entrenamiento curados por expertos y entornos de evaluación que ejecuten y validen los resultados contra observables reales. Las empresas que desarrollan aplicaciones a medida para sectores técnicos deben tener esto muy presente: la integración de agentes de IA no puede limitarse a un prompt ingenioso; necesita un ecosistema de datos y reglas de dominio que el modelo pueda consultar y verificar.

En Q2BSTUDIO entendemos que la simulación avanzada, como la que ofrece PHITS, es solo un ejemplo de los muchos procesos técnicos que pueden beneficiarse de una estrategia de inteligencia artificial bien diseñada. Nuestro equipo combina experiencia en desarrollo de software, cloud computing y ciberseguridad para construir soluciones que van más allá de un simple asistente conversacional. Por ejemplo, desplegar un agente de IA capaz de generar simulaciones PHITS requiere una infraestructura cloud robusta —ya sea AWS o Azure— para gestionar los picos de demanda computacional, así como medidas de ciberseguridad que protejan datos sensibles de radiación y diseños de reactores. Además, los resultados de las simulaciones pueden integrarse en paneles de Business Intelligence con Power BI para visualizar decenas de variables y facilitar la toma de decisiones en tiempo real.

La combinación de inteligencia artificial con un benchmark como PHITSBench abre la puerta a desarrollar agentes especializados que aprendan de sus errores y se alineen con los criterios de los físicos e ingenieros. En Q2BSTUDIO trabajamos en la creación de agentes IA que no solo generan código, sino que además verifican la coherencia física de los parámetros, sugieren optimizaciones y documentan automáticamente el proceso de simulación. Todo ello sobre plataformas cloud seguras y escalables, y con la posibilidad de exportar los resultados a herramientas de BI para su análisis.

El análisis de fallos de PHITSBench es particularmente instructivo. Los errores dominantes no son sintácticos sino semánticos: el modelo elige un observable incorrecto (por ejemplo, flujo de neutrones en lugar de dosis absorbida) o lo configura con unidades erróneas. Esto demuestra que la verdadera barrera no es la generación de código, sino la comprensión de la física subyacente. Para superarla, los sistemas de IA necesitan integrarse con ontologías del dominio y motores de razonamiento simbólico. En Q2BSTUDIO exploramos precisamente esa línea: combinar redes neuronales con bases de conocimiento formales para que los agentes no solo escriban código, sino que además justifiquen sus elecciones. Este enfoque es particularmente valioso en sectores regulados como la energía nuclear o la radioterapia, donde cada decisión debe ser trazable y verificable.

En resumen, PHITSBench representa un hito en la evaluación de modelos de lenguaje para simulación científica, pero también una llamada de atención: la IA generalista no basta. Se necesita una infraestructura de conocimiento, herramientas de ejecución validadas y plataformas cloud seguras. Las empresas que ofrecen aplicaciones a medida y servicios de inteligencia artificial como Q2BSTUDIO están en una posición única para construir esos ecosistemas. Nuestro expertise en cloud computing, ciberseguridad, BI y agentes IA nos permite acompañar a organizaciones científicas e industriales en la adopción de estas tecnologías, creando soluciones que no solo escriben código, sino que entienden el problema. Contacte con nosotros para explorar cómo podemos transformar sus procesos de simulación con inteligencia artificial a medida.

A BREAK?

Play for a moment before you go

OUR SERVICES

How we can help you

Do you have a project in mind?

Tell us your vision and we'll turn it into a software solution. Whatever the scope, we make your idea real.