Dieser Artikel gehört zu unserem Glossar mit Begriffen rund um Noten.
Bei der Stem-Separation nimmst du einen fertigen Song, bei dem schon alles zu einer Spur zusammengemischt ist, und zerlegst ihn wieder in seine Teile: den Gesang hier, die Drums da, Bass und Gitarren jeweils für sich. Das klingt nach Zauberei, und vor ein paar Jahren war es das auch mehr oder weniger. Beim Transkribieren kommt das Thema ständig auf, weil sich ein Teil oft leichter aufschreiben lässt, wenn er für sich allein steht. Um eine Aufnahme mit Songscription zu transkribieren, musst du aber keine Stems trennen. Nützlich ist die Trennung nur für bestimmte Aufgaben.
Was Stem-Separation ist
Ein Stem ist ein einzelner Teil eines Songs auf einer eigenen Spur. Im Studio entstehen Songs aus getrennten Spuren für Gesang, Drums, Bass, Keys und so weiter, und beim Mastering werden sie zu einer einzigen Stereodatei zusammengefügt. Danach sind die einzelnen Spuren für alle, die den Song nur hören, normalerweise weg. Stem-Separation macht diesen letzten Schritt rückgängig. Sie bekommt nur die gemischte Datei, schätzt daraus ab, wie jeder Teil geklungen hat, und gibt dir die Teile als getrennte Spuren zurück. Üblich sind Gesang, Drums, Bass und eine Sammelspur für alles andere. Manche Tools teilen diese Sammelspur noch weiter auf, etwa in Klavier, Gitarre und weitere Instrumente.
Wie das funktioniert
Leicht ist das nicht. Sobald Klänge gemischt sind, überlagern sie sich im selben Frequenzbereich, und es gibt keine saubere Naht, an der man schneiden könnte. Moderne Separation arbeitet mit neuronalen Netzen, die mit großen Sammlungen von Songs trainiert wurden, deren einzelne Originalspuren bekannt sind. Das Modell lernt dabei den Fingerabdruck jeder Art von Klangquelle, also wie sich eine Stimme bewegt, wie eine Snare knallt und wie gleichmäßig ein Bass das tiefe Fundament hält. Mit diesen gelernten Mustern schätzt es ab, welcher Anteil des gemischten Klangs zu welchem Instrument gehört.
Hinter der Transkription selbst steckt eine verwandte Idee, die wir im Artikel So funktioniert KI-Musiktranskription genauer erklären. Auch dort arbeitet ein Modell, das aus Beispielen gelernt hat, statt festen Regeln zu folgen, die jemand von Hand aufgeschrieben hat.
Warum einzelne Spuren beim Transkribieren helfen
Hört ein Transkriptionsmodell eine komplette Band auf einmal, muss es erst mehrere Instrumente auseinanderhalten, die sich im selben Tonbereich in die Quere kommen, bevor es überhaupt etwas aufschreiben kann. Bekommt es stattdessen einen einzelnen, getrennten Teil, fällt dieses Problem größtenteils weg, und es kann sich darauf konzentrieren, die Noten eines Instruments richtig zu treffen. Wenn du aus einem ganzen Song richtige Noten willst, in denen jedes Instrument eine eigene Notenzeile hat, ist es deshalb oft am saubersten, zuerst die Stems zu trennen und dann jeden Stem mit dem passenden Modell zu transkribieren. Diesen Ablauf zeigen wir Schritt für Schritt im Artikel über das Transkribieren von Band- und Mehrspuraufnahmen.
Artefakte beim Trennen
Perfekt ist eine Trennung nie. Weil sich die Teile im ursprünglichen Mix Frequenzen geteilt haben, hat ein getrennter Stem oft verräterische Macken. Er klingt wässrig oder verschmiert, die anderen Instrumente klingen leise durch, oder der Stimme fehlt das Hauchige. Wenn du einfach nur zuhörst, kann das stören. Fürs Transkribieren ist es meistens in Ordnung, weil das Modell vor allem wissen will, wo Noten anfangen und welche Tonhöhe sie haben, und nicht, ob der Klang makellos ist.
Einen Fall, in dem es wirklich schiefgeht, gibt es allerdings. Kommt ein Stem mit starken Artefakten zurück, kann seine Transkription schlechter ausfallen als die der Originalaufnahme, in der ja noch alle Informationen stecken. Deshalb sind Stems ein Werkzeug für bestimmte Fälle und kein Standardschritt.
Für Songscription brauchst du keine Stems
Songscription transkribiert eine Aufnahme genau so, wie du sie hochlädst. Du musst vorher keine Stems trennen, und für die meisten Aufgaben lohnt sich der Aufwand auch nicht:
- Ein einzelnes Instrument? Lade die Aufnahme einfach so hoch. Klavier oder Gitarre solo wird direkt transkribiert, samt Akkorden. Das ist der polyphone Fall, den wir im Artikel über polyphone Klaviertranskription erklären.
- Ein ganzer Song, und alles soll in einer gemeinsamen Fassung stehen? Lass den Mix in ein zusammengefasstes Arrangement transkribieren, meistens einen Klavierauszug, der Melodie, Harmonien und Bass auf einem Klaviersystem zusammenbringt. Trennen musst du dafür nichts.
- Ein ganzer Song, und jedes Instrument soll einzeln aufgeschrieben werden? Das ist der eine Fall, in dem es sich meistens auszahlt, den Song zuerst in Stems zu zerlegen. Dann kannst du jeden Teil für sich transkribieren.
Zur Stem-Separation greifst du also, wenn dein Ziel es verlangt. Voraussetzung für eine brauchbare Transkription mit Songscription ist sie nicht. Im Normalfall lädst du einfach deine Aufnahme hoch. Wie du mit mehreren Instrumenten gleichzeitig umgehst, beschreiben wir ausführlich im Artikel Kann KI mehrere Instrumente gleichzeitig transkribieren?
Wann sich Stems lohnen
Der zusätzliche Schritt lohnt sich, wenn du aus einer dichten Aufnahme jedes Instrument einzeln aufgeschrieben brauchst, wenn ein Teil unter allem anderen begraben ist und du ihn für sich hören und transkribieren willst oder wenn du remixen statt transkribieren möchtest. Willst du einen Song lernen oder arrangieren, was die meisten vorhaben, kommst du mit einer direkten Transkription der Aufnahme oder einem Klavierauszug des ganzen Mixes schneller ans Ziel und gehst dem Risiko von Artefakten ganz aus dem Weg. Überleg dir, was am Ende herauskommen soll, und such die Methode danach aus. Zur Trennung greifst du erst, wenn der einfachere Weg dir nicht die Aufteilung der Noten liefert, die du brauchst. So oder so fängst du mit derselben Aufnahme an, die du schon hast.
Häufige Fragen
Was ist Stem-Separation?
Bei der Stem-Separation wird eine fertig abgemischte Aufnahme wieder in ihre einzelnen Teile zerlegt, die sogenannten Stems: Gesang auf einer Spur, Drums auf einer anderen, Bass und weitere Instrumente jeweils für sich. Heutige Tools machen das mit KI-Modellen, die mit riesigen Musiksammlungen trainiert wurden. Die Modelle lernen dabei, wie jede Art von Klangquelle klingt, und holen sie aus dem Mix heraus. So wird aus einer Aufnahme, die bisher nur eine einzige gemischte Datei war, eine Reihe einzelner Spuren, die du stummschalten, neu abmischen oder nacheinander transkribieren kannst.
Muss ich die Stems vor dem Transkribieren trennen?
Nein. Songscription transkribiert eine Aufnahme so, wie sie ist, du musst sie also vorher nicht in Stems zerlegen. Ein einzelnes Instrument wird direkt transkribiert, auch wenn Klavier oder Gitarre volle Akkorde spielen. Einen kompletten Mix kannst du in ein zusammengefasstes Arrangement transkribieren lassen, zum Beispiel in einen Klavierauszug. Stem-Separation ist ein zusätzlicher Schritt, den du machen kannst, aber nicht musst, um eine Transkription zu bekommen. Sie kann helfen, wenn du aus einer vollen Aufnahme jedes Instrument auf einer eigenen Notenzeile haben willst.
Verschlechtert Stem-Separation die Klangqualität?
Sie kann Artefakte erzeugen. Weil sich die Teile eines Mixes überlagern und dieselben Frequenzen teilen, ist keine Trennung perfekt. Getrennte Stems klingen oft leicht verschmiert oder wässrig, oder es sind leise noch andere Instrumente zu hören. Beim Anhören kann das stören. Fürs Transkribieren ist es meistens kein Problem, weil das Modell vor allem klare Noteneinsätze und Tonhöhen braucht und keinen makellosen Klang. Hat ein Stem starke Artefakte, kann die Transkription des ursprünglichen Mixes sogar das sauberere Ergebnis bringen.
Du brauchst weder Stems noch Vorbereitung, nur deine Aufnahme. Lade einen Song hoch und lass ihn so transkribieren, wie er ist.
