CASUS
Navigation öffnen

Produkt

Produkt ausklappen

Kunden

Kundenmenü öffnen

Unternehmen

Unternehmensmenü öffnen

Sicherheit

Preise

Casus Logo

CASUS Blog

KI Zeitersparnis für Anwälte: Was Studien zeigen

Zuletzt aktualisiert am

von

CASUS Team Logo

CASUS Team

|

Wer wir sind

KI Zeitersparnis ist kein fester Prozentsatz, der sich auf jede juristische Aufgabe übertragen lässt. Eine aktuelle internationale Befragung berichtet bei 62 Prozent der Teilnehmenden von sechs bis zwanzig Prozent eingesparter Wochenarbeitszeit. Das ist ein wichtiges Signal, aber noch kein Beweis für die Wirkung in einer bestimmten Kanzlei. Entscheidend sind Aufgabe, Ausgangslage, Kontrolle und Nacharbeit.

Die aktuellste belastbare Zahl richtig lesen

Der Future Ready Lawyer Report 2026 von Wolters Kluwer basiert auf einer Onlinebefragung von 810 Jurist:innen aus Kanzleien und Rechtsabteilungen in den USA, China und mehreren europäischen Ländern. Deutschland war Teil der Erhebung, die Schweiz und Österreich jedoch nicht. Die Befragung fand vom 8. bis 25. August 2025 statt.

62 Prozent der Befragten gaben an, durch KI zwischen sechs und zwanzig Prozent ihrer wöchentlichen Arbeitszeit einzusparen. Im Mittel entspricht das laut Studienseite knapp zehn Prozent der Arbeitswoche. Wichtig ist die Einheit: Die Studie spricht von einem Anteil der Wochenarbeitszeit, nicht von sechs bis zwanzig eingesparten Stunden.

Ebenso wichtig ist die Messart. Es handelt sich um eine Selbstauskunft. Die Befragten schätzten ihre eigene Zeitersparnis; ihre Aufgaben wurden nicht unter kontrollierten Bedingungen gestoppt und mit einer manuellen Vergleichsgruppe geprüft. Der Wert eignet sich deshalb als Hinweis auf wahrgenommene Effizienz, nicht als Garantie für ein konkretes Mandat.

Adoption, Nutzung und Produktivität sind drei verschiedene Dinge

Aktuelle Studien verwenden ähnliche Begriffe für unterschiedliche Messgegenstände. Die ILTA Technology Survey 2026 berichtet, dass sich 94 Prozent der 508 befragten Kanzleien mit generativer KI beschäftigen. Diese Zahl umfasst Einsatz und Exploration. Sie sagt nicht, wie häufig einzelne Personen das Werkzeug verwenden oder wie viel Zeit sie dadurch sparen.

Ein Produktnutzungs-Event beantwortet nochmals eine andere Frage: Es kann zeigen, dass ein Workflow gestartet wurde, aber nicht, ob er abgeschlossen, nützlich oder schneller war. Ein gestarteter Review kann abgeschlossen, abgebrochen oder mit erheblicher Nacharbeit verbunden sein. Nutzung bleibt deshalb von Produktivität getrennt. Für den praktischen Einsatz helfen die Leitfäden zur KI-Einführung in Kanzleien und zur Einführung in Rechtsabteilungen.

Für eine saubere Bewertung müssen deshalb drei Ebenen getrennt bleiben:

Ebene

Geeignete Messgröße

Was sie nicht beweist

Adoption

freigegebene Zugänge, aktive Personen

tatsächliche Nutzung

Nutzung

gestartete und abgeschlossene Workflows

Zeitgewinn oder Qualität

Wirkung

Zeit, Nacharbeit, materielle Korrekturen, Ergebnis

Übertragbarkeit auf andere Aufgaben

Wer diese Ebenen vermischt, kann aus vielen Logins eine Effizienzsteigerung oder aus einer schnellen Einzelaufgabe einen allgemeinen ROI ableiten. Beides wäre methodisch falsch.

Warum pauschale Werte von 40 bis 70 Prozent nicht tragen

Der bisherige CASUS-Artikel begann mit der Aussage, Legal AI ermögliche bei Dokumentenanalyse, Recherche und Vertragsprüfung zwischen 40 und 70 Prozent Zeitersparnis. Dafür fehlte eine Studie, die alle drei Aufgabentypen, Märkte und Arbeitsweisen gemeinsam abdeckt. Der Wert wird deshalb in dieser Neufassung nicht weiterverwendet.

Auch spektakuläre Fallbeispiele zu Millionen Dokumenten sind kein geeigneter Durchschnitt für den Alltag einer Kanzlei. Eine Massenextraktion, eine Recherchefrage und die Verhandlung einer individuell formulierten Klausel besitzen völlig verschiedene Ausgangslagen. Der Anteil automatisierbarer Arbeit und der notwendige Kontrollaufwand unterscheiden sich entsprechend.

Das gilt auch für Benchmarks zur Antwortqualität. Wenn ein KI-System bei standardisierten Fragen eine hohe Punktzahl erreicht, ist damit weder die Bearbeitungszeit eines vollständigen Mandats noch die Qualität eines anderen Rechtsgebiets gemessen. Genauigkeit und Zeit sind zwei getrennte Ergebnisgrößen.

Die Aufgabe bestimmt den möglichen Zeitgewinn

Hohe Effizienz ist am ehesten dort plausibel, wo ein wiederkehrender Ablauf, ein klarer Prüfauftrag und ein einheitliches Ergebnisformat vorliegen. Beispiele sind die erste Strukturierung eines Dokumentenbestands, die Extraktion festgelegter Felder oder der Vergleich wiederkehrender Verträge mit einem gepflegten Playbook. Ein strukturierter Review ist dabei nur der messbare Arbeitsschritt, nicht schon der Nachweis eines besseren Ergebnisses.

Weniger vorhersehbar ist der Zeitgewinn bei offenen Rechtsfragen, ungewöhnlichen Definitionen, unvollständigen Unterlagen oder strategischen Abwägungen. Hier kann eine schnelle erste Antwort zusätzliche Prüfzeit erzeugen. Ein überzeugend formulierter, aber unzutreffender Hinweis spart keine Zeit, wenn die verantwortliche Person ihn erst entdecken und korrigieren muss.

Auch der Wechsel zwischen Werkzeugen gehört in die Rechnung. Wenn ein Ergebnis aus einer separaten Anwendung kopiert, neu formatiert und an die richtige Stelle im Dokument gesetzt werden muss, kann ein Teil des Analysegewinns wieder verloren gehen. Die technische Laufzeit allein ist deshalb keine sinnvolle Produktivitätskennzahl.

Ein Pilot braucht eine Ausgangslage

Ein belastbarer Pilot beginnt vor dem Einsatz des Werkzeugs. Wählt fünf bis zehn wiederkehrende, bereits abgeschlossene Aufgaben aus, für die Ergebnis und tatsächlicher Aufwand bekannt sind. Die Fälle sollten ähnlich genug sein, damit ein Vergleich sinnvoll ist, aber nicht so künstlich, dass sie den realen Arbeitsalltag verfehlen.

Für jede Aufgabe werden mindestens diese Werte erfasst:

  1. aktive Bearbeitungszeit ohne KI;

  2. aktive Bearbeitungszeit mit KI;

  3. Zeit für Kontrolle und Nacharbeit;

  4. Zahl materieller Korrekturen vor Freigabe;

  5. Vollständigkeit des verlangten Ergebnisses;

  6. Entscheidung, ob das Ergebnis im Mandat verwendbar war.

Die Zeit sollte nach derselben Regel gemessen werden. Wer in der manuellen Variante Recherchepausen einrechnet, in der KI-Variante aber nur die technische Generierung stoppt, erzeugt einen künstlichen Vorteil. Ebenso müssen Einarbeitung, Prompt-Anpassung und Übertragung in das Arbeitsdokument berücksichtigt werden.

Qualität ist keine optionale Nebenbedingung

Eine schnellere Bearbeitung ist nur dann ein Gewinn, wenn das Ergebnis die vorab definierte Qualitätsgrenze erreicht. Für eine Vertragsprüfung können dazu die gefundenen relevanten Punkte, unbegründete Hinweise, übersehene Ausnahmen und die korrekte Zuordnung zur Vertragsstelle gehören. Für eine Recherche sind Quellenbezug, Aktualität, Zuständigkeit und Überprüfbarkeit mögliche Kriterien.

Die Bewertung sollte vor dem Pilot festgelegt werden. Sonst verschiebt sich der Maßstab nachträglich zugunsten eines gewünschten Ergebnisses. Besonders bei kleinen Stichproben kann ein einzelner leichter oder schwieriger Fall den Durchschnitt stark verändern. Deshalb sollten Median, Bandbreite und einzelne Ausreisser neben dem Mittelwert dokumentiert werden.

Zeitgewinn ist nicht automatisch Honorar- oder Umsatzgewinn

Auch ein methodisch sauber gemessener Zeitgewinn beantwortet noch nicht die wirtschaftliche Frage. Im Stundensatzmodell kann eine schnellere Bearbeitung zunächst weniger fakturierbare Zeit bedeuten. Bei Pauschalen oder festen Budgets kann dieselbe Effizienz die Marge verbessern. In beiden Modellen entsteht zusätzlicher Wert nur, wenn die freigewordene Kapazität sinnvoll eingesetzt oder der Nutzen gegenüber Mandant:innen sichtbar gemacht wird.

Die Untersuchung des Thomson Reuters Institute aus dem August 2026 unterstreicht diese Lücke. Sie basiert auf 116 Interviews mit Kanzleiführungskräften und 2.527 als besonders stark bewerteten Anwält:innen. Viele sehen eine AI-Strategie, deutlich weniger können sie mit Arbeitsabläufen, Mandantenwert und wirtschaftlicher Umsetzung verbinden.

Für die interne Entscheidung sollten daher Zeit, Qualität und wirtschaftliche Verwendung getrennt berichtet werden. Ein Pilot kann operativ erfolgreich sein, obwohl noch kein Umsatzanstieg messbar ist. Umgekehrt kann eine schnelle Aufgabe ohne ausreichende Kontrolle kurzfristig günstig wirken und später Kosten verursachen.

Ein ehrliches Ergebnis ist oft aufgabenspezifisch

Eine gute Auswertung endet nicht mit dem Satz "Legal AI spart zehn Prozent". Sie kann beispielsweise lauten: Bei der ersten Prüfung wiederkehrender Verträge sank die mediane Bearbeitungszeit in acht vergleichbaren Fällen, während die Nacharbeit gleich blieb. Bei offenen Rechtsfragen war die Stichprobe zu klein und die Streuung zu groß für eine Aussage.

Diese Form ist weniger spektakulär, aber für eine Kauf- und Einführungsentscheidung wertvoller. Sie zeigt, wo das Werkzeug eingesetzt werden sollte, welche Kontrolle notwendig ist und wo weiterhin unzureichende Daten vorliegen.

Wer den Ablauf praktisch testen möchte, kann CASUS im eigenen Team erproben. Vor dem ersten Test sollten Aufgabe, Vergleichsbasis, Qualitätsgrenze und verantwortliche Kontrolle feststehen.

FAQ

Wie viel Zeit spart Legal AI durchschnittlich?

Es gibt keinen belastbaren Durchschnitt für alle juristischen Aufgaben. In der internationalen Future Ready Lawyer Befragung 2026 berichteten 62 Prozent von sechs bis zwanzig Prozent eingesparter Wochenarbeitszeit. Das ist eine Selbstauskunft und keine Garantie für einen bestimmten Workflow.

Bedeutet sechs bis zwanzig Prozent sechs bis zwanzig Stunden?

Nein. Die Studie bezieht sich auf den prozentualen Anteil der wöchentlichen Arbeitszeit. Die Einheit darf nicht in Stunden umgedeutet werden.

Sind internationale Studien auf die Schweiz, Deutschland und Österreich übertragbar?

Nur eingeschränkt. Aufgaben, Organisationen, Rechtsordnungen und verwendete Produkte unterscheiden sich. Die Studien liefern Vergleichspunkte; die Wirkung eines konkreten Workflows sollte mit eigenen Fällen und einer dokumentierten Methode gemessen werden.

Welche Zeit gehört in die Messung?

Zur Gesamtzeit gehören Vorbereitung, Nutzung des Werkzeugs, Kontrolle, Nacharbeit und Übertragung in das Arbeitsdokument. Nur die Generierungszeit zu messen unterschätzt den tatsächlichen Aufwand.

Wie viele Fälle braucht ein Pilot?

Für einen ersten internen Vergleich können fünf bis zehn wiederkehrende Fälle einen Ausgangspunkt bilden. Kleine Stichproben bleiben unsicher. Median, Bandbreite und Ausreisser sollten deshalb sichtbar bleiben und nicht zu einer allgemeinen Marktzahl verdichtet werden.

Warum reicht eine Nutzungsquote nicht als Produktivitätsbeweis?

Eine Nutzungsquote zeigt, dass eine Funktion geöffnet oder gestartet wurde. Sie sagt nicht, ob der Workflow abgeschlossen wurde, wie viel Kontrolle nötig war oder ob das Ergebnis die Qualitätsgrenze erreicht hat.

Dein Legal-AI-Associate.

Supported by Innosuisse, the Swiss Innovation Agency
Capterra rating: 5 out of 5
Spin-off from the University of St. Gallen

CASUS Technologies AG
Beethovenstrasse 48
8002 Zürich
Schweiz
contact@getcasus.com

Frag deine bevorzugte AI zu CASUS

ChatGPT
Claude
Perplexity

Dein Legal-AI-Associate.

Supported by Innosuisse, the Swiss Innovation Agency
Capterra rating: 5 out of 5
Spin-off from the University of St. Gallen

CASUS Technologies AG
Beethovenstrasse 48
8002 Zürich
Schweiz
contact@getcasus.com

Frag deine bevorzugte AI zu CASUS

ChatGPT
Claude
Perplexity

Dein Legal-AI-Associate.

Supported by Innosuisse, the Swiss Innovation Agency
Capterra rating: 5 out of 5
Spin-off from the University of St. Gallen

CASUS Technologies AG
Beethovenstrasse 48
8002 Zürich
Schweiz
contact@getcasus.com

Frag deine bevorzugte AI zu CASUS

ChatGPT
Claude
Perplexity