Inhalt
Remote-Meetings sind längst keine Ausnahme mehr. Die meisten von uns verbringen inzwischen mehr Stunden pro Woche in Teams, Zoom oder Meet als in jedem echten Besprechungsraum. Wer sich dabei vom Laptop oder Handy zuschaltet oder einen Meter vom Mikrofon entfernt sitzt, schickt der Gegenseite trotzdem meist einen dünnen, zentral abgemischten Stream.
Das wiegt schwerer als es klingt. Ein Gruppengespräch lebt von winzigen Laufzeit-, Pegel- und Spektralunterschieden zwischen den beiden Ohren, und genau die wirft eine Plattform weg, sobald sie mehrere Mikrofonsignale in einen Kanal zusammenlegt.
Im Folgenden: was dabei verloren geht, was Spatial Audio zurückbringt, welche Plattformen es schon können, und was man noch heute am eigenen Rechner ändern kann.
Ein echtes Gespräch findet im Kreis statt. Die Leute sitzen in unterschiedlichen Winkeln, Stimmen kommen aus verschiedenen Richtungen, und das Gehirn trennt die Sprechenden sofort voneinander, ohne dass man eine Anstrengung bemerkt.
Remote-Meeting-Setups machen das Gegenteil. Mehrere Mikrofonsignale werden zu einem einzigen, zentral positionierten Stream zusammengelegt. Darüber laufen dann noch Rauschunterdrückung, automatische Pegelregelung und Optimierung auf einen einzelnen Sprecher, und all das plättet genau die spektralen und Pegelunterschiede, die vorher die räumliche Information getragen haben.
Drei Mechanismen leisten die Arbeit, und ein Mono-Call hebelt alle drei aus.
Interaurale Laufzeitunterschiede, kurz ITD, sind der minimale Unterschied in der Ankunftszeit zwischen den beiden Ohren. Eine Stimme von links erreicht das linke Ohr den Bruchteil einer Millisekunde früher, und unser Gehör liest diese Verzögerung erstaunlich präzise.
Interaurale Pegelunterschiede, kurz ILD, sind der Unterschied in der Lautstärke zwischen den Ohren. Der Kopf wirft einen akustischen Schatten, das abgewandte Ohr hört also weniger. Am stärksten ist der Effekt bei hohen Frequenzen, wo der Kopf den Schall am wirksamsten abschattet.
Spektrale Merkmale sind die Klangfärbung, die Kopf, Ohrmuscheln und Oberkörper einem Schall aufprägen, bevor er das Trommelfell erreicht. Hohe Frequenzen werden am stärksten gefiltert, und das Gehirn liest aus diesen Veränderungen die Höhe heraus sowie die Frage, ob eine Quelle vor oder hinter einem liegt. Das ist der Teil, der die vertikale und die sagittale Ebene trägt, wo Laufzeit und Pegel allein so gut wie nichts verraten.
Spektral- und Pegelmerkmale tragen in komplexen Umgebungen die Hauptlast, also genau dort, wo binaurale Laufzeitmerkmale unzuverlässig werden. Und das Gehirn wird im Kombinieren dieser Merkmale mit der Erfahrung besser, weshalb ein Format, das sie herausrechnet, schlimmer ist als es auf dem Papier aussieht.
Wenn dasselbe oder ein eng korreliertes Signal beide Ohren gleichzeitig erreicht, ohne nennenswerte ITD, ohne ILD und ohne spektrale Unterschiede, hat das Gehirn keinen Ort, an den es den Schall legen könnte. Es schließt daraus, die Quelle müsse im Kopf sitzen.
Aus Audio-Ingenieurssicht heißt das Im-Kopf-Lokalisation, und es ist der Normalfall, nicht der Ausreißer. Über Kopfhörer hört man fremde Stimmen irgendwo zwischen den eigenen Ohren. Über Laptop-Lautsprecher bekommt man die mildere Variante: einen einzigen, undeutlichen Klumpen vor sich.
Die Folge ist kognitiv, nicht akustisch. Sobald die räumliche Trennung fehlt, muss man zusätzliche Arbeit leisten, um Stimmen zu trennen, Sprechende zu erkennen und dem Wechsel zu folgen. Über einen Arbeitstag summiert sich das.
Das Gegenteil der Im-Kopf-Lokalisation heißt Externalisierung, und das ist das Versprechen von weiter oben.
Über Kopfhörer funktioniert sie, indem jede teilnehmende Person als eigenes Audio-Objekt behandelt wird, statt alle vorher zusammenzumischen. Für jedes Objekt verzögert und dämpft der Renderer ein Ohr leicht, formt den Klang so, als wäre der Schall an Kopf und Ohrmuschel entlanggelaufen, und fügt kleine Raumreflexionen hinzu. Das Gehirn liest diese Hinweise und legt die Stimme nach außen.
Am Ausgang steht weiterhin ein ganz normales Zweikanalsignal. Nur die Wahrnehmung ändert sich, und zwar vollständig. Es klingt plötzlich, als trüge man gar keine Kopfhörer, weil man die Stimmen um sich herum ortet statt in sich. Selbst die meisten Laptop-Stereolautsprecher transportieren davon einen Teil.
Wichtig dabei: das ist Software. Man braucht kein Raummikrofon, kein spezielles Headset und keine neue Hardware. Ein gewöhnliches Laptop-Mikrofon und ein Paar kabelgebundene Kopfhörer reichen.
Im echten Leben sitzen die Leute nicht auf einem einzelnen Stuhl vor dir. Sie sitzen um dich herum. Spatial Audio in der Telefonkonferenz setzt sie dorthin zurück, wo sie hingehören.
Vermutlich hat jede und jeder nicht nur einen der besagten Videotelefonie-Dienste in Verwendung. So werden die meisten schon einen Überblick über die Stärken und Schwächen der jeweiligen Anbieter haben: Manche können mehr Personen anzeigen, manche sind übersichtlicher, andere haben jene Hintergrundfunktion, und so weiter.
Tatsache ist jedenfalls, dass die Unterschiede lange fast ausschließlich auf der visuellen Ebene lagen. Auditiv musste man sich meist mit spärlichen Audioeinstellungen und Mono begnügen. Das hat sich inzwischen geändert.
Ja. Zoom hat Spatial Audio für Meetings und Webinare eingeführt und positioniert jede Stimme im Stereofeld nach ihrem Platz in der Gallery- oder Immersive-Ansicht.
Vorausgesetzt ist die Zoom Desktop App ab Version 6.0.10 unter Windows, macOS oder Linux. Es funktioniert nur in der Gallery-, der Side-by-side-Gallery- und der Immersive-Ansicht, es gilt ausschließlich für das Mikrofon-Audio der Teilnehmenden und nicht für Ton aus einer Bildschirmfreigabe, und über Bluetooth läuft es nicht. Zoom Rooms unterstützen es ebenfalls, sofern Stereo-Lautsprecher verbaut sind.
Ob das eigene Ausgabegerät taugt, lässt sich schnell prüfen: Spatial Audio in den Audio-Einstellungen aktivieren, dann „Lautsprecher testen“ verwenden. Bei aktivem Spatial Audio spielt der Klingelton fünfmal, jedes Mal von einer anderen Position. Kommt nur ein statischer Ton, unterstützt das Gerät die Funktion nicht.
Unabhängig davon bietet Zoom weiterhin einen Stereo- und einen Hi-Fi-Modus. Die positionieren keine Stimmen im Raum, heben aber die Qualität des Übertragenen und erlauben es, zweikanaliges Material zu senden. In der Praxis nutze ich das regelmäßig, um Spatial-Audio-Beispiele im Call vorzuführen, und zwar aus einem Grund, den kaum jemand kennt: Man kann gleich zweimal in Stereo übertragen, einmal über das Mikrofon und zusätzlich über die Bildschirmfreigabe. Mir ist keine andere Konferenzsoftware bekannt, die beides kann, weder Teams noch Discord noch FaceTime. So kommen binaurale Beispiele bei Events wie diesem hier überhaupt erst ans Ohr.
Teams legt die Stimme jedes Teilnehmenden auf dessen Position in der Galerieansicht. Wie bei Zoom braucht es USB-verkabelte Stereokopfhörer oder -Lautsprecher oder die eingebauten Stereolautsprecher des Geräts. Bluetooth-Audiogeräte werden nicht unterstützt, weil sie in einen Telefon-Modus fallen, der nur datenreduzierte Mono-Wiedergabe erlaubt.
Die Besprechung muss mehr als zwei Teilnehmende in der Galerieansicht haben, damit der Effekt greift, und Teams schaltet ihn automatisch ab, wenn Netzwerkbandbreite oder Arbeitsspeicher knapp werden.
So wird er aktiviert: „Einstellungen und mehr“ öffnen, dann „Geräte“, unter „Lautsprecher“ das kompatible Gerät auswählen und den Schalter für räumliche Audiowiedergabe umlegen. Die Einstellung bleibt für künftige Besprechungen erhalten. Alternativ lässt sie sich pro Termin über „Geräteeinstellungen“ vor dem Beitritt setzen.
Zwei Einschränkungen sollte man kennen, bevor man das für eine ganze Organisation freigibt. In Besprechungen mit Live-Verdolmetschung spielt Teams mit aktivem Spatial Audio Original und Übersetzung gleich laut ab, was den Zweck der Verdolmetschung zunichtemacht. Und mit aktiviertem Musikmodus verliert man den hochauflösenden Full-Band-Pfad. In beiden Fällen muss man Spatial Audio abschalten und neu beitreten.
Offizielle Anleitung von Microsoft
Apple hat Spatial Audio mit iOS 15 in FaceTime gebracht. Die Stimme ist aus der Richtung zu hören, in der die jeweilige Kachel auf dem Bildschirm liegt, dazu werden Störgeräusche deutlich stärker herausgefiltert. Diese Filterung ist wichtiger als sie wirkt: Räumliches Rendering funktioniert am besten, wenn jede Stimme möglichst isoliert ankommt, denn übrig gebliebener Raumlärm wird mitspatialisiert.
Dolby OptiView, früher die Dolby.io Communications API, bringt Spatial Audio auf der API-Ebene in die Konferenz. Teilnehmende werden in einen gemeinsamen 3D-Audio-Raum gesetzt und hören einander von ihren jeweiligen Positionen. Wenn jemand spricht, leuchtet der zugehörige Kreis auf und der Ton kommt aus diesem Bereich der Oberfläche. Für alle, die ein eigenes Konferenzprodukt bauen statt ein fremdes zu konfigurieren, ist das die relevante Ebene.
Frühere Versuche zeigten in dieselbe Richtung. Clubhouse brachte Spatial Audio 2022 auf iOS und lief prompt in das Stereo-Problem, das jede Implementierung trifft: Eine Stereoquelle ist ungleich schwerer zu positionieren als eine Monoquelle. Der Ausweg dort war, aus linkem und rechtem Kanal Monoquellen abzuleiten, um etwas Stereobreite zu behalten und trotzdem räumliche Tiefe zu gewinnen.
Die Hersteller einigen sich nicht auf einen Namen. Microsoft sagt oft „immersive audio“, Zoom sagt „spatial audio“, andere sagen „objektbasiert“ oder „binaural“. Darunter liegt jedes Mal dasselbe Muster: jede sprechende Person getrennt halten, positionieren, binaural rendern, dezente Raumanteile dazugeben.
Das ist wichtig, sobald man Produkte vergleicht oder ein Lastenheft schreibt. Es zählt der Mechanismus, nicht das Marketing-Etikett.
Einzelgespräche sind nicht wirklich das Problem. Mit einem einzigen Gegenüber stützt sich das Gehirn auf Kontext und Videobild, räumliche Merkmale tragen da nur wenig bei.
In dem Moment, in dem eine dritte Person dazukommt, ändert sich die Lage. Überlappende Sprache, ähnliche Tonhöhe oder Klangfarbe und schneller Sprecherwechsel machen es schwer zu sagen, wer was gesagt hat, und mit jeder weiteren Person wird es schlimmer. Genau deshalb schalten Teams und Zoom Spatial Audio erst oberhalb von zwei Teilnehmenden zu. Diese Schwelle ist nicht willkürlich.
Verteilt man die Stimme jeder Person im 3D-Audio-Raum, so wie wir es in der Realität gewohnt sind, kommt die Trennung zurück. Genau genommen hilft schon reines Stereo, wie das Beispiel von High-Fidelity-Gründer Philip Rosedale hörbar macht. Dasselbe Beispiel zeigt aber auch die Grenze: Es fehlt die Räumlichkeit, man bekommt also ein Links-Rechts-Panning statt echter Externalisierung, und die Stimmen sitzen unangenehm nah am Ohr.
Das sind keine hypothetischen Vorteile. Räumliche Trennung ermöglicht Spatial Unmasking, denselben psychoakustischen Effekt, mit dem man in einem lauten Raum einer Stimme folgen und die übrigen ausblenden kann, besser bekannt als Cocktail-Party-Effekt.
Für eine wirklich akkurate Schalllokalisation helfen kleine Kopfbewegungen. Wenn wir im Alltag mit unseren Ohren etwas genauer orten wollen, bewegen wir meist unbewusst den Kopf. Durch die Änderung des Winkels zur Schallquelle ändern sich Laufzeit- und Pegelunterschiede zwischen den Ohren, und das Gehirn nutzt diese Änderung als zusätzlichen Beleg.
Diese Bewegungen in einen Video Call zu holen klingt nach viel Technik, es gibt die Bausteine aber längst.
Apple hat mit den AirPods Pro und den AirPods Max, Samsung mit den Galaxy Buds Pro bereits Head-Tracking-fähige Kopfhörer auf dem Markt, um zwei bekannte Vertreter zu nennen. Daneben lassen sich externe Head-Tracker an gewöhnlichen Kopfhörern befestigen. Mehr dazu in diesem Blogpost.
Nicht jeder besitzt derartige Audiogeräte, was Head-Tracking über die Webcam für Desktop-Anwendungen interessant macht. Die Gesichtserkennung liefert die Kopfausrichtung, und das 3D-Audio-Schallfeld wird in Echtzeit daran angepasst.
Für spatialisierte Video Calls ist das nahe dran an einem Gratis-Mittagessen. Der Call setzt eine Kamera ohnehin voraus, es fallen also keine zusätzlichen Anschaffungen an, und die Spatialisierung kann im Browser laufen. Diesbezüglich sind die Kollegen von atmoky ganz vorne dabei.
Etwas weiter gedacht ließe sich der Videoaspekt sogar vernachlässigen, zumindest wenn es um das Auseinanderhalten der Personen geht. Ein spatialisiertes Telefonat würde ein ganz anderes Präsenzgefühl der anderen Person vermitteln, was ebenso auf psychologischer Ebene wirkt wie auf akustischer, besonders in einem Plug-and-Play-System.
Es gibt eine Vielzahl von Anbietern solcher Bird-View-Meeting-Places, zum Beispiel Gather Town, SpatialChat oder das bereits erwähnte High Fidelity.
Personen, die mehreren Videokonferenzen pro Tag beiwohnen, kennen das Gefühl. Man ist nach dem Video Call wie ausgelaugt, obwohl man vielleicht gar nicht so aktiv dabei war. Dieses Phänomen wird als Zoom Fatigue bezeichnet, und es muss nicht unbedingt etwas mit dem Inhalt des Meetings zu tun haben.
Mono-Wiedergabe verlangt vom Gehirn mehr Leistung. Weil alle Stimmen ohne Richtungseindruck auf unsere Ohren treffen, ist das Gehirn damit beschäftigt, sie zu differenzieren und zuzuordnen. Im realen Gespräch entfällt dieser Mehraufwand, weil wir Schallquellen einfach lokalisieren.
Rennies und Kidd haben genau das im Journal of the Acoustical Society of America gemessen: Binaurales Hören verbessert sowohl die Sprachverständlichkeit als auch den Höraufwand, und beide bewegen sich nicht zwangsläufig im Gleichschritt (Paper).
Gibt man die räumliche Szene zurück, übernimmt das Gehör diese Arbeit wieder nebenbei. Meetings werden weniger anstrengend und über einen Tag gerechnet auch produktiver. Diesen Ansatz verfolgt das Team von atmoky in Webmeetings: eine natürliche akustische Szene aufbauen, um die Sprachverständlichkeit zu erhöhen und Spatial Unmasking wirklich auszunutzen.
Für Normalhörende ist ein flacher Mono-Mix anstrengend. Für Menschen mit Hörverlust kann er darüber entscheiden, ob sie einem Meeting folgen können oder nicht.
Spatial Unmasking ist einer der Mechanismen, die bei Hörverlust ohnehin nachlassen. Nimmt man die räumlichen Merkmale aus dem Call heraus, entzieht man eine Bewältigungsstrategie, die bereits unter Druck stand.
Rendering pro Sprecher gibt sie zurück, und der Gewinn ist für diese Gruppe größer als für alle anderen im Meeting.
Wer in seiner Organisation eine Barrierefreiheits-Richtlinie hat, in der Untertitel stehen, sollte Spatial Audio in dieselbe Zeile schreiben. Es kostet nichts, es freizuschalten, und es ist dieselbe Funktion, die das Meeting für alle übrigen besser macht.
Das beste räumliche Rendering überlebt eine schlechte Wiedergabekette nicht. Das meiste im Folgenden kostet nichts.
Bitte alle, Kopfhörer aufzusetzen. Laptop-Lautsprecher strahlen in die lokalen Mikrofone ein, und die Meeting-Clients versuchen zwar, dieses Übersprechen zu unterdrücken, verschlucken dabei aber regelmäßig nützliche Sprache oder erzeugen Artefakte. Kopfhörer beseitigen das Übersprechen, senken Echo und Hintergrundgeräusche und erhalten die Sprachklarheit für beide Seiten. Eine kleine Höflichkeitsregel, die eine ganze Klasse von Problemen abräumt.
Wer selbst Mühe hat, Calls zu folgen, sollte zuerst hier ansetzen: Ein ordentlicher Kopfhörer verbessert die Verständlichkeit unabhängig davon, was die Plattform tut.
Geschlossen und ohrumschließend ist die beste allgemeine Wahl: größere Treiber, vollerer Klang und passive Isolation. Genau diese Kombination ist der Grund, warum sie im professionellen Audio dominieren.
Aufliegende Kopfhörer sind der kompakte Kompromiss. Leichter und transportabler, ordentliche Sprachklarheit, weniger Isolation.
In-Ears sind am kleinsten und am praktischsten. Moderne hochwertige Modelle liefern erstaunlich gute Verständlichkeit, vorausgesetzt sie dichten wirklich ab.
In allen drei Fällen klingt kabelgebunden meist besser. Viele Call-Clients schalten ein Bluetooth-Gerät in einen Telefon-Modus oder einen Codec mit niedriger Bitrate, sobald es als Mikrofon dient. Das kostet Qualität und deaktiviert, wie oben beschrieben, Spatial Audio in Teams und Zoom gleichermaßen.
Jeder Meeting-Client behandelt Ton anders, deshalb hilft nur Ausprobieren statt Annehmen. Jede Option für hohe Qualität, Originalton oder Hi-Fi einschalten. Die Rauschunterdrückung zwischen Niedrig und Aus umschalten. Kabel und Bluetooth kurz gegeneinander vergleichen.
Dann kurze A/B-Vergleiche von 30 bis 60 Sekunden machen. Manchmal hilft die Rauschunterdrückung erheblich. Manchmal hält eine zurückgedrehte Enthallung die Stimmen voller und leichter verfolgbar, und manchmal nimmt sie zu viel vom ursprünglichen Dialog weg. Das ist subjektiv, also hinhören und die Kombination behalten, die im eigenen Raum und mit dem eigenen Gehör die klarste Sprache liefert.
Eine Frage, die mir oft gestellt wird: Warum ist die Sprachspur in manchen kurzen Videos während Webinaren oder Online-Trainings so viel schwerer zu verfolgen als in anderen?
Die Antwort ist Frequenzüberlappung plus Dynamik. Musik füllt fast das gesamte hörbare Band, grob 20 Hz bis 20 kHz, während Sprache etwa zwischen 100 Hz und 8 kHz liegt. Beide konkurrieren um dieselben Frequenzen und verdecken sich gegenseitig.
Dazu kommt, dass Musik üblicherweise so gemischt und dynamisch komprimiert wird, dass sie einen recht konstanten Pegel hält, während Sprache stark schwankt. Ein gleichmäßiges Musikbett verdeckt eine schwankende Sprachspur durchgehend statt nur in Lücken, und für Menschen mit Hörverlust ist der Effekt deutlich schlimmer. Wer solches Material produziert: Das Bett unter der Sprache abzusenken bringt mehr als jede Klangregelung an der Stimme.
Was man tatsächlich nicht braucht ist ein teures, fancy 3D Mikrophon – auch wenn es hier eine schöne Übersicht gibt 😉 . Es reicht ein ganz normales Mono-Mikrofon am Headset oder das ohnehin im Laptop eingebaute. Denn die Virtualisierung der Räumlichkeit passiert Software-seitig. Dabei werden dem Audiostream Meta-Daten zugeschrieben und das Programm berechnet in Echtzeit, wie das virtuelle Audio klingen muss.
Das eigentliche Problem liegt davor. Hörbare Artefakte aus der Datenreduktion während der Übertragung sind weiterhin verbreitet, und jede Stufe Rauschunterdrückung ist eine Gelegenheit, Sprache zu verlieren. NVIDIA hat mit der RTX Voice Applikation gezeigt, wie weit Geräuschunterdrückung kommen kann, und das ist hier doppelt nützlich: Man will keine virtuelle Schallquelle, die zusätzlich Laptop-Gebläse und Tastaturgeklimper mitbringt, sondern saubere Sprache, sauber im Raum platziert.
Der zweite offene Punkt ist die Lücke zwischen Consumer- und Raumtechnik. Wer über kabelgebundene Kopfhörer zugeschaltet ist, bekommt den vollen Effekt. Dasselbe Meeting aus einem Konferenzraum mit Deckenmikrofonarray oder vom Handy über Bluetooth bekommt ihn nicht. Hybride Meetings liefern damit aus demselben Stream zwei recht unterschiedliche Erlebnisse, und das ist bisher nicht gelöst.
Audio war der letzte Teil der Videokonferenz, dem ernsthafte Aufmerksamkeit zuteil wurde, und es ist der Teil mit dem meisten verbleibenden Spielraum. Remote-Meetings sind inzwischen dauerhaft, guter Ton ist also keine Kür mehr.
Gibt man die räumlichen Merkmale zurück, sinkt der Höraufwand, und man erkennt schneller, wer gerade spricht. Für Teilnehmende mit Hörverlust kann es darüber entscheiden, ob sie dem Meeting überhaupt folgen. Die großen Hersteller liefern die Funktion bereits aus.
Wer eine Organisation führt, hat drei Schritte, die fast nichts kosten: die räumlichen oder immersiven Funktionen freischalten, für die ohnehin bezahlt wird, eine einfache Anleitung zur Wiedergabe veröffentlichen, und kurze A/B-Vergleiche machen, um herauszufinden, was für das eigene Publikum tatsächlich funktioniert. Damit wird aus einer flachen, aufmerksamkeitsfressenden Konferenz etwas, das sich mehr wie die echte Welt verhält.
Solche Lösungen kann ich mit meinen Kollegen von atmoky auch direkt für Webmeetings, Virtuelle Interaktion, Video Calls und Co anbieten.
Eine Fassung dieses Beitrags erschien in Hearing Matters, dem Magazin von Hearing Matters Australia, Ausgabe August/September 2026.
Du willst 3D Audio nicht nur theoretisch verstehen, sondern in einem echten Projekt einsetzen?
Jetzt unverbindlich anfragen →