SemaPLC teste des agents de code PLC avec des vérifications en environnement d’exécution réel
Le banc d’essai vérifie la logique PLC générée au regard des spécifications, de la compilation et du comportement une fois déployée.
Pourquoi c'est important
Ces travaux font passer l’évaluation du code PLC de la génération isolée à l’intégration et à la vérification à l’exécution, une approche plus proche des usages industriels. Ils montrent aussi que les contrôles de comportement dynamique peuvent révéler des problèmes que la compilation ou les tests statiques peuvent manquer.
Points clés
- 1.SemaPLC exige des contrôles externes avant de marquer les tâches de code PLC comme terminées.
- 2.Il a affiché un taux moyen de réussite vérifiée de 72,6 % sur des tâches POU indépendantes.
- 3.Le comportement dynamique à l’exécution s’est révélé la couche d’évaluation la plus instructive.
Des chercheurs ont présenté SemaPLC, un banc d’essai agentique ancré dans des projets et soumis à des garde-fous de vérification pour la génération de code PLC. Le système ne marque une tâche comme terminée qu’après confirmation, dans les journaux, par des contrôles externes de la spécification, de la compilation et du comportement sur un environnement d’exécution PLC réel. Sur 117 tâches POU indépendantes, SemaPLC a atteint un taux moyen strict de réussite vérifiée de 72,6 % sur sept modèles, et il a obtenu les meilleurs résultats moyens sur la compilation intégrée, le comportement statique et le comportement dynamique dans un volet de 65 tâches en contexte projet.
⚡ À tester aujourd'hui
Utiliser la comparaison de traces en environnement d’exécution réel pour évaluer la logique PLC générée par des LLM dans des projets concrets.
Sources et articles originaux
Ce brief résume et renvoie vers la couverture des médias ci-dessous.
Ce brief vous a plu ? Recevez le prochain par e-mail.
Plus dans Recherche
Une startup affirme que les données sont essentielles aux avancées de l’IA contre le cancer
Selon TechCrunch, la startup estime que l’IA est encore loin de guérir le cancer sans de meilleures données.
HarnessRisk évalue les défaillances de sécurité dans les harnais d’agents
Le benchmark teste des attaques à différentes phases des harnais d’agents, tandis que des travaux connexes étudient le provisionnement propre à chaque tâche.
Agent Lightning v1.0 cible le RL agentique avec harnais
Le framework relie des harnais d’agents arbitraires au post-entraînement par apprentissage par renforcement.