Hermes: LLMs kombinieren informelle und formale Mathematik, höhere Genauigkeit
In der Welt der großen Sprachmodelle (LLMs) hat informelle Mathematik lange Zeit die Flexibilität und Effizienz bei der Argumentationsbildung ermöglicht. Doch ohne formale Kontrolle bleiben logische Lücken und subtile Fehler oft unentdeckt. Hermes, ein neuer Tool‑Assisted Agent, verbindet die beiden Ansätze: Er führt informelle Überlegungen durch und prüft gleichzeitig jeden Schritt in Lean, einem etablierten Theorem‑Prover.
Der Agent nutzt ein spezielles Speicher‑Modul, das die Kontinuität von Beweisen über lange, mehrstufige Argumentationsketten hinweg bewahrt. Dadurch können LLMs explorativ denken und gleichzeitig die Richtigkeit ihrer Schlussfolgerungen garantieren – alles in einem einzigen Workflow.
Bei vier anspruchsvollen mathematischen Benchmarks, von kleinen Modellen bis zu den neuesten Systemen, zeigte Hermes eine zuverlässige Steigerung der Rechengenauigkeit. Gleichzeitig senkte es den Token‑Verbrauch und die Rechenkosten deutlich im Vergleich zu belohnungsbasierten Ansätzen. Auf dem schwierigen AIME'25‑Datensatz erreichte Hermes bis zu 67 % höhere Genauigkeit bei gleichzeitig 80 % weniger FLOPs.
Hermes demonstriert, dass die Kombination aus informeller Kreativität und formaler Verifikation LLMs neue Leistungsniveaus in der mathematischen Problemlösung eröffnet.