Suche

Finde Modelle, Firmen und Themen

Suche im News-Archiv nach Themen, die du dauerhaft verfolgen willst.

Ergebnisse für “Mistral”
Forschung

<p>DPO-Optimierung zeigt Phasenwechsel: Logikleistung schwankt mit β</p> <p>In einer neuen Studie wurde die Direct Preference Optimization (DPO) für drei 7‑B‑Modelle mit offenen Gewichten systematisch untersucht. Dabei wurde der Parameter β, der die Ausrichtung der Modelle steuert, in feinen Schritten variiert, um die Auswirkungen auf die Logikfähigkeit zu beobachten.</p> <p>Bei Mistral zeigte sich ein starkes, nicht‑monotones Verhalten: Die Logikmarge wird nur in einem engen Bereich um β ≈ 10⁻² positiv, au

arXiv – cs.LG
Forschung

<h1>LLMs enthüllen unterschätzte Vertrauenssignale – fundierte Erkenntnisse</h1> <p>Eine neue Studie zeigt, dass moderne Sprachmodelle wie Llama 3.1, Qwen 2.5 und Mistral bereits ohne gezielte Anweisungen psychologisch relevante Vertrauenssignale in ihren Antworten verankern. Diese Entdeckung legt nahe, dass die Vertrauenswürdigkeit von KI‑Systemen bereits im Pre‑Training‑Prozess entsteht.</p> <p>Die Forscher nutzten das PEACE‑Reviews‑Datensatz, der Web‑ähnliche Texte mit Bewertungen zu kognitiven Einschätz

arXiv – cs.AI