Die Digitalisierung der Unternehmenskommunikation hat die steuerliche Außenprüfung grundlegend verändert. Während früher vor allem Buchhaltungsunterlagen, Verträge und ERP-Daten im Mittelpunkt standen, rückt zunehmend auch elektronische Kommunikation in den Fokus der Finanzverwaltung. Mit Beschluss vom 30.04.2025 (XI R 15/23) hat der Bundesfinanzhof (BFH) wichtige Leitplanken für die Vorlage von E-Mails im Rahmen steuerlicher Außenprüfungen gesetzt. Dabei geht es längst nicht mehr nur um die Frage, ob E-Mails Gegenstand einer Außenprüfung sein können. Die eigentliche Herausforderung beginnt dort, wo Unternehmen bestimmen müssen, welche E-Mails für den jeweiligen Prüfungsgegenstand steuerlich relevant sind.
Das Erstqualifikationsrecht als Ausgangspunkt
Gerade bei komplexen Sachverhalten wie Verrechnungspreisen, konzerninternen Leistungsbeziehungen, Umstrukturierungen, Funktionsverlagerungen oder internationalen Lieferketten können E-Mails wichtige Hinweise auf die tatsächlichen wirtschaftlichen Hintergründe und Entscheidungsprozesse einer Transaktion liefern.
Dabei bedeutet „steuerrelevant“ jedoch keineswegs, dass jede geschäftliche E-Mail einen Bezug zum Steuerrecht aufweisen muss. Gemeint sind vielmehr Nachrichten, deren Inhalt für die Besteuerung eines Unternehmens von Bedeutung sein kann. Gleichzeitig weist ein erheblicher Teil der in Unternehmen vorhandenen E-Mail-Bestände keinen steuerlichen Bezug auf.
Vor diesem Hintergrund stellt sich die Frage, in welchem Umfang die Finanzverwaltung die Vorlage umfangreicher E-Mail-Bestände verlangen kann. Nach dem Beschluss des BFH ist die Finanzverwaltung im Rahmen einer Außenprüfung grundsätzlich berechtigt, sämtliche E-Mails mit steuerlichem Bezug anzufordern, sofern das Vorlageverlangen hinreichend bestimmt ist. Ein erst noch zu erstellendes Gesamtjournal, das auch Informationen über E-Mails ohne steuerlichen Bezug enthält, kann hingegen nicht verlangt werden. Dem Steuerpflichtigen verbleibt im Rahmen des sogenannten Erstqualifikationsrechts grundsätzlich die Möglichkeit, nicht steuerlich relevante Daten vor der Vorlage auszusondern.
Von besonderer praktischer Bedeutung ist dies, weil umfangreiche E-Mail-Bestände regelmäßig sowohl steuerlich relevante als auch nicht steuerlich relevante Kommunikation enthalten und zudem private oder besonders vertrauliche Inhalte umfassen können.
Zugleich macht der Beschluss eine praktische Herausforderung sichtbar. Bei umfangreichen Datenbeständen kann bereits die Identifikation der steuerlich relevanten Kommunikation erheblichen technischen und organisatorischen Aufwand verursachen. In der Praxis stellt sich daher die Frage, wie Unternehmen aus oftmals Millionen historischer E-Mails diejenigen Nachrichten identifizieren können, die für den jeweiligen Prüfungsgegenstand steuerlich relevant sind.
Z1- und Z3-Zugriff als Wege zur Datenbereitstellung
Die Identifikation und Bereitstellung steuerrelevanter E-Mails sind eng mit den verschiedenen Formen des Datenzugriffs im Rahmen der steuerlichen Außenprüfung verbunden. Im Folgenden stehen insbesondere der unmittelbare Datenzugriff (Z1) und die Datenüberlassung (Z3) im Fokus.
Beim unmittelbaren Datenzugriff erhält die Finanzverwaltung Lesezugriff auf die vom Unternehmen bereitgestellten Daten und kann innerhalb dieses Datenbestands eigene Auswertungen durchführen. Bei umfangreichen E-Mail-Beständen kann dies insbesondere mit Blick auf die Abgrenzung steuerlich relevanter Kommunikation und den Schutz anderer Inhalte praktische Herausforderungen mit sich bringen. Für die Aufbereitung und Sichtung können E-Discovery-Plattformen eingesetzt werden.
Bei der Datenüberlassung werden die angeforderten Daten der Finanzverwaltung in einem maschinell auswertbaren Format zur Verfügung gestellt. Einen direkten Lesezugriff auf das bereitstellende System erhält sie dabei nicht.
Unabhängig von der Form der Bereitstellung stellt sich dieselbe zentrale Frage. Wie lassen sich steuerrelevante E-Mails aus umfangreichen Datenbeständen sachgerecht und nachvollziehbar identifizieren?
Die Realität in den Unternehmen
E-Mail-Systeme und Archivierungskonzepte sind in der Regel nicht darauf ausgelegt, Kommunikation für spätere Außenprüfungen nach ihrer steuerlichen Relevanz zu klassifizieren. Eine fortlaufende steuerliche Klassifizierung einzelner Nachrichten ist bislang regelmäßig nicht Bestandteil bestehender Archivierungsprozesse.
Die rückwirkende Auswertung umfangreicher historischer E-Mail-Bestände kann daher erhebliche technische und organisatorische Herausforderungen verursachen, insbesondere wenn längere Zeiträume oder größere Personenkreise betroffen sind. Hinzu kommt, dass ältere Daten häufig in unterschiedlichen Archivsystemen, Backup-Umgebungen oder ausgelagerten Speicherlösungen vorgehalten werden, die im Regelfall nur eingeschränkte Such- und Auswertungsmöglichkeiten bieten.
Warum klassische E-Discovery-Methoden an ihre Grenzen stoßen
Methoden und Systeme aus dem Bereich E-Discovery bieten grundsätzlich einen geeigneten Ansatz. Die Ausgangsdaten werden technisch aufbereitet, durchsuchbar gemacht und dedupliziert, wodurch sich insbesondere bei E-Mail-Beständen die Datenmenge bereits erheblich reduzieren kann. Anschließend lassen sich die Bestände anhand von Suchabfragen, zeitlichen Eingrenzungen, Absender- und Empfängerinformationen sowie weiteren Kriterien eingrenzen. Die verbleibenden Treffer werden fachlich auf ihre Relevanz überprüft.
Bei umfangreichen Datenbeständen stößt dieses lineare Vorgehen jedoch an Grenzen. Steuerlich relevante Sachverhalte, etwa zu Verrechnungspreisen oder Betriebsstätten, lassen sich häufig nicht anhand einzelner Schlagworte zuverlässig identifizieren, während schlüsselwortbasierte Suchen zugleich zahlreiche fachlich irrelevante Treffer erzeugen können.
Eine ausschließlich manuelle Überprüfung kann daher selbst mit größeren Review-Teams erheblichen Zeit- und Ressourcenaufwand verursachen. Die praktische Ausübung des Erstqualifikationsrechts kann entsprechend aufwendig werden.
KI als Lösungsansatz
An dieser Stelle eröffnen moderne Technologien auf Basis künstlicher Intelligenz (KI) neue Möglichkeiten. Methoden auf Basis von generativer KI beschränken sich dabei nicht auf das Auffinden einzelner Schlüsselbegriffe und begrenzter Muster, sondern berücksichtigen auch inhaltliche Zusammenhänge und sprachliche Kontexte – bei zugleich drastisch reduziertem Trainingsaufwand.
Ausgangspunkt einer KI-gestützten Klassifikation ist zunächst die fachliche Definition der steuerlichen Relevanz. Hierzu ist festzulegen, welche Sachverhalte, Transaktionen, Themenfelder, Personen und Zeiträume für den jeweiligen Prüfungsgegenstand relevant sein können. Auf dieser Grundlage lassen sich geeignete Kriterien und Instruktionen für die Klassifikation entwickeln. Die Technologie ersetzt damit nicht die steuerlich-fachliche Beurteilung, sondern ermöglicht deren strukturierte und skalierbare Anwendung auf umfangreiche Datenbestände.
Auf Basis dieser fachlichen Vorgaben können KI-gestützte Review-Modelle eingesetzt werden, die E-Mails anhand ihres Inhalts und Kontexts klassifizieren. Dabei können beispielsweise Themen, Kommunikationszusammenhänge und sprachliche Strukturen berücksichtigt werden, die auf eine mögliche steuerliche Relevanz im Hinblick auf den jeweiligen Prüfungsgegenstand hindeuten. Als Ergebnis wird beispielsweise jeder E-Mail ein Relevanzwert zugeordnet. Dieser ermöglicht es, Datenbestände nach ihrer möglichen steuerlichen Relevanz zu priorisieren und besonders relevante Dokumente gezielt einer weiteren fachlichen Prüfung zuzuführen.
Entscheidend ist dabei die Qualitätssicherung. Aus der E-Discovery-Praxis stehen etablierte Validierungsverfahren und Kennzahlen zur Verfügung, anhand derer sich die Qualität der Klassifikation messen, dokumentieren und durch geeignete Stichproben überprüfen lässt. Auf diese Weise wird der Auswahlprozess nachvollziehbar, reproduzierbar und somit gegenüber der Finanzverwaltung defensibel.
Zugleich kann der Einsatz solcher Verfahren den Aufwand gegenüber einer ausschließlich manuellen Sichtung erheblich reduzieren.
Von der Reaktion zur Prävention
Die derzeit geführte Diskussion ist vor allem durch einen rückblickenden Ansatz geprägt. Unternehmen stehen vor der Herausforderung, historische E-Mail-Bestände nachträglich auf ihre steuerliche Relevanz zu untersuchen. Bei umfangreichen Herausgabeverlangen kann dies mit erheblichem technischem und organisatorischem Aufwand verbunden sein.
Mit zunehmender Klarheit über den Umfang der Vorlagepflichten und das bestehende Erstqualifikationsrecht dürfte es für Unternehmen allerdings schwieriger werden, allein mit dem hohen Aufwand einer nachträglichen Auswertung zu argumentieren. Vor diesem Hintergrund gewinnen Lösungen an Bedeutung, mit denen sich E-Mail-Kommunikation bereits während ihres Lebenszyklus hinsichtlich ihrer möglichen steuerlichen Relevanz klassifizieren lässt.
Moderne Cloud-Technologien in Verbindung mit KI eröffnen grundsätzlich die Möglichkeit, Kommunikationsdaten bereits während ihres Informationslebenszyklus zu klassifizieren. In Microsoft Purview können E-Mails beispielsweise automatisiert anhand unternehmensspezifischer Kriterien gekennzeichnet werden. Neben regelbasierten Ansätzen, die etwa auf Schlüsselbegriffen, Metadaten oder bekannten Datenmustern beruhen, können auch KI-gestützte Klassifikationsansätze zum Einsatz kommen.
Auf Grundlage zuvor definierter fachlicher Kriterien kann damit eine frühzeitige und konsistente Klassifizierung steuerlich relevanter Kommunikation unterstützt werden. Dies kann Unternehmen dabei helfen, entsprechende Informationen strukturiert zu verwalten und die vorgenommenen Klassifizierungen nachvollziehbar zu dokumentieren.
Eine frühzeitige Klassifikation eröffnet darüber hinaus Potential für das steuerliche Risikomanagement. Kommunikationsinhalte und -muster, die beispielsweise auf Verrechnungspreisthemen, grenzüberschreitende Sachverhalte, Umstrukturierungen oder andere steuerlich sensible Vorgänge hindeuten, könnten früher identifiziert und einer fachlichen Bewertung zugeführt werden. Die Klassifikation steuerrelevanter Kommunikation könnte sich damit von einer reinen Reaktion auf externe Prüfungsanforderungen zu einem Bestandteil moderner Tax-Compliance-Prozesse entwickeln.
Ob und in welchem Umfang sich solche Ansätze in der Praxis etablieren werden, bleibt abzuwarten. Klar ist jedoch bereits heute, dass die Verbindung steuerlich-fachlicher Expertise mit geeigneten technologischen Verfahren neue Möglichkeiten eröffnet, umfangreiche Kommunikationsbestände nachvollziehbar und effizient zu bewältigen.



