Nutzer können aus eigenen Daten und Anwendungsfällen Prüfstrecken bauen und Modelle nach Qualität, Kosten und Geschwindigkeit je Aufgabe vergleichen. Adressiert wird die bekannte Schwäche öffentlicher Ranglisten.
Artificial Analysis betreibt bislang öffentliche Vergleiche von Sprachmodellen. Mit Optima können Anwender nun eigene Prüfstrecken aus internen Daten und konkreten Anwendungsfällen erzeugen und darauf mehrere Modelle gegeneinander messen – nach Ergebnisqualität, Kosten und Antwortzeit je Aufgabe.
Der Anlass ist bekannt: Öffentliche Ranglisten prüfen allgemeine Fähigkeiten, nicht die konkrete Aufgabe eines Unternehmens. Ein Modell, das in einer Rangliste vorn liegt, kann bei der Auswertung eigener Serviceanfragen, Angebotstexte oder Lieferscheine deutlich schlechter abschneiden als ein günstigeres.
Damit verschiebt sich die Entscheidungsgrundlage. Wer die Kosten je erledigter Aufgabe im eigenen Ablauf kennt, kann kleinere Modelle gezielt dort einsetzen, wo sie ausreichen, und teure Modelle auf die Fälle beschränken, die sie brauchen. Ohne solche Messung bleibt die Anbieterwahl eine Vermutung.
Was das für Entscheider bedeutet
- Bauen Sie für Ihre zwei bis drei wichtigsten KI-Anwendungsfälle eine eigene Prüfstrecke aus echten, anonymisierten Vorgängen.
- Messen Sie Kosten je erledigter Aufgabe statt Preis je Million Token – erst diese Größe ist mit Ihrem Budget vergleichbar.
- Wiederholen Sie die Messung nach jedem Modellwechsel des Anbieters; Ergebnisse ändern sich auch ohne Ihr Zutun.
Diese Meldung wurde automatisch aus der genannten Quelle erstellt und vor der Veröffentlichung maschinell geprüft. Das Bild ist ein Symbolbild und zeigt weder den Vorgang noch eine reale Person. Wie diese Zeitung entsteht
