AnleitungMusiktranskriptionAndrew Carlins•8 Min. Lesezeit

So bekommst du genaue KI-Transkriptionen, Schritt für Schritt

Wie gut eine KI-Transkription wird, entscheidet sich zum großen Teil, bevor du etwas hochlädst. Mit dieser Reihenfolge bekommst du saubere, brauchbare Noten statt viel Nacharbeit: Aufnahme, Dateiformat, Instrumentenwahl und das Durchsehen am Ende.

Genaue KI-Transkriptionen: Aufnahmequalität, Dateiformat, Instrumentenwahl und ein letzter Durchgang zum Prüfen

Ob eine KI-Transkription genau wird, entscheidet sich zum großen Teil, bevor du etwas hochlädst. Was aus dem Modell herauskommt, hängt davon ab, was hineingegangen ist. Ein paar Entscheidungen bei Aufnahme und Einrichtung, die du jedes Mal gleich triffst, entscheiden darüber, ob du brauchbare Noten bekommst oder an der Transkription noch lange nacharbeiten musst.

Am meisten zählt die Aufnahmeumgebung. Danach kommen das Dateiformat, die Wahl des Instruments und das Durchsehen vor dem Export.

Fang mit sauberem Audio an

Songscription kommt auch mit Audio zurecht, das nicht perfekt ist. Lädst du einen Livemitschnitt, eine Handyaufnahme oder sonst etwas nicht ganz Ideales hoch, bekommst du trotzdem eine brauchbare Transkription. Die folgenden Schritte sind also keine Voraussetzungen. Sie machen den Ablauf einfacher und das Ergebnis sauberer, denn je besser das Signal am Anfang ist, desto weniger musst du hinterher aufräumen. Was du realistisch erwarten kannst, steht in unserem Artikel darüber, wie genau KI-Transkription je nach Instrument ist. Warum die Genauigkeit schwankt und wovon ein sauberes Ergebnis abhängt, erklären wir in einem eigenen Beitrag.

Die Aufnahmeumgebung wirkt sich stärker auf die Genauigkeit aus als alles andere. Aus einem sauberen Signal, das in einem ruhigen Raum entstanden ist, holt ein Modell durchweg bessere Ergebnisse heraus als aus einer guten Performance, die in einem lauten oder halligen Raum aufgenommen wurde.

Den Raum in den Griff bekommen

Nimm im ruhigsten Raum auf, den du hast. Klimaanlage, Straßenlärm und Computerlüfter landen alle im Signal, das das Transkriptionsmodell verarbeitet. Harte Oberflächen erzeugen Hall, der die Noteneinsätze verwischt. Dann erkennt das Modell schlechter, wo ein Ton aufhört und der nächste anfängt. In einem eingerichteten Zimmer mit Teppich, Vorhängen und Bücherregalen ist das Problem schon deutlich kleiner, ganz ohne Akustikelemente.

Mikrofon und Pegel

Stell das Mikrofon bei akustischen Instrumenten nah an die Quelle. Bei verstärkten Instrumenten richtest du es auf die Box, statt quer durch den Raum aufzunehmen. Je näher das Mikrofon steht, desto mehr Direktsignal und desto weniger Raumklang hast du.

Behalte die Pegelanzeige im Blick und halt die Spitzen deutlich unter der Übersteuerungsgrenze. Übersteuern erzeugt digitale Verzerrung und damit falsche Obertöne. Das Modell kann diese Artefakte nicht von echten Tönen unterscheiden, also tauchen sie in den Noten auf. Mach vor dem richtigen Take einen kurzen Probedurchgang.

Das richtige Dateiformat wählen

Songscription nimmt MP3-, WAV- und M4A-Dateien an. Du kannst auch direkt einen Link von YouTube, Instagram oder TikTok einfügen. Das ist praktisch, wenn du mit einer Referenzaufnahme arbeitest.

Wenn du die Wahl hast, nimm WAV. Verlustfreie Dateien behalten alle Frequenzdetails, die das Modell braucht, um benachbarte Tonhöhen auseinanderzuhalten und das Ausklingen der Töne genau zu verfolgen. Verlustbehaftete Formate werfen einen Teil dieser Informationen weg, und hinterher lässt er sich nicht mehr zurückholen.

MP3 mit hoher Bitrate reicht für die meisten Aufgaben. Bei niedrigeren Bitraten können Probleme auftauchen. Wenn du eine Datei vor dem Hochladen exportierst oder umwandelst, entscheide dich deshalb lieber für mehr Qualität als für eine kleinere Datei. Startest du mit einer komprimierten Datei, erfährst du in unserer Anleitung, wie aus einer MP3 Noten werden, genauer, was dich erwartet.

Den richtigen Instrumententyp auswählen

Songscription hat für jedes Instrument ein eigenes Transkriptionsmodell. Ein falsch gewählter Instrumententyp gehört deshalb zu den häufigsten Gründen für schwache Ergebnisse, und er lässt sich leicht vermeiden. Ein Modell, das auf Klavier ausgelegt ist, geht an dieselbe Audiodatei grundlegend anders heran als eins für Gitarre oder Gesang.

Im Moment werden Klavier, Gitarre, Bass und Gesang unterstützt, dazu einige weitere Instrumente. Prüf vor dem Hochladen, ob die Einstellung zu dem passt, was wirklich auf der Aufnahme zu hören ist. Spielen mehrere Instrumente, wählst du die Einstellung für den Part, den du vor allem in Noten haben willst. Die Modelle sind mit kompletten Mixen trainiert. Meistens reicht ihnen die richtige Instrumenteneinstellung, um diesen Part herauszuhören, und du musst ihn vorher nicht isolieren.

Was besonders gut klappt

Am Klaviermodell arbeiten wir schon am längsten, und es liefert bei ganz unterschiedlichen Aufnahmequalitäten und Stilen meist die zuverlässigsten Ergebnisse. Wenn du mit Klaviermaterial arbeitest, musst du in der Regel weniger nacharbeiten als bei jedem anderen Instrumententyp.

Einstimmige Melodieinstrumente wie Geige, Flöte, Trompete und Saxofon funktionieren ebenfalls sehr gut, vor allem bei nah mikrofonierten Aufnahmen. Gitarre, Bass und Gesang lassen sich aus sauberem Audio zuverlässig transkribieren. Das Ergebnis ist hier meist ein solider Arbeitsentwurf, an dem du nur wenig nachbessern musst.

Schlagzeug ist ein eigenes Thema. Schlagzeug in herkömmliche Notation zu übertragen ist schwierig, trotzdem bekommst du mit Songscription brauchbare Schlagzeugstimmen. Plan beim Durchsehen nur etwas mehr Zeit ein als bei einem Melodieinstrument.

Das Exportformat wählen

Songscription hat mehrere Exportmöglichkeiten. Für Noten zum Ausdrucken empfehlen wir PDF. MIDI passt, wenn du die Töne in eine DAW übernehmen willst oder eine vielseitigere Datei brauchst. MusicXML nimmst du zum Weiterbearbeiten in einem Notationsprogramm und Guitar Pro für Tabulatur. Am Ende zählt, welches Format am besten zu deinem nächsten Schritt passt.

Vor dem Export durchsehen

Kein Transkriptionsmodell liefert jedes Mal fehlerfreie Noten. Beim Durchsehen reicht es deshalb, die Fehler zu finden, die beeinflussen, wie die Musik gelesen oder gespielt wird.

Für diesen Durchgang nimmst du am besten die Piano Roll. Sie zeigt die Transkription neben der Wellenform der Originalaufnahme, und du kannst beides gleichzeitig abspielen. Was nicht zusammenpasst, fällt dir so sofort auf. Töne, die nicht dazugehören, löschst du direkt in der Piano Roll, und bis zum Export bleibt alles an einem Ort. Wir empfehlen, die Transkription Abschnitt für Abschnitt durchzugehen.

Mit einem kompletten Mix arbeiten

Man könnte meinen, ein fertig produzierter Song müsse vor der Transkription erst in Stems aufgeteilt werden. Mit Songscription ist das meistens nicht nötig. Die Modelle sind darauf trainiert, das ausgewählte Instrument herauszuhören, auch wenn andere Instrumente mitspielen. Bei den meisten fertigen Mixen kannst du den Song also so hochladen, wie er ist, dein Instrument wählen und das Trennen dem Modell überlassen. Geht dein Instrument in einer dichten Produktion unter, hilft eine aufgeräumtere Stelle oder eine klarere Aufnahme mehr als jede Vorbearbeitung.

Wenn es besonders genau sein muss

Bei den meisten Transkriptionen ist ein kleiner Fehler kein Drama. Bei manchen schon. Wenn du Material für Schüler:innen vorbereitest, ein Leadsheet veröffentlichst oder Noten an andere Musiker:innen weitergibst, muss alles genauer stimmen, als wenn du nur eine Idee für dich festhältst.

Hier lohnt sich ein sorgfältiger Durchgang in der eingebauten Piano Roll mehr als irgendwo sonst. Spiel die Transkription zusammen mit der Originalaufnahme ab und achte vor dem Export auf alles, was nicht zusammenpasst. Am meisten haben Lehrkräfte davon, die Material für ihren Unterricht vorbereiten. Den ganzen Ablauf zeigen wir in unserer Anleitung, wie du einen Song für Schüler:innen in Noten überträgst. Auch die automatische Schwierigkeitsanpassung für Noten hilft dabei. Sie passt Schwierigkeitsgrad und Notendichte an die Person an, die die Noten später spielt.

Wozu das Durchsehen da ist

Dass du die Noten durchsehen musst, heißt nicht, dass das Tool schlecht gearbeitet hat. Auch Profis, die von Hand transkribieren, überarbeiten ihre Arbeit. KI-Transkription übernimmt automatisch den Großteil der Noteneingabe, also Tonhöhen erkennen, den Rhythmus quantisieren und das Notenbild setzen. Beim Durchsehen kümmerst du dich um den Rest, und durch diese Arbeitsteilung sparst du Zeit. Mit einer gut vorbereiteten Ausgangsdatei und einem konzentrierten Durchgang kommst du in aller Regel zu einem Ergebnis, mit dem du arbeiten kannst. Lässt du eins von beidem weg, verschiebt sich die Arbeit meist nach hinten, und dort sind Fehler schwerer und langsamer zu beheben.

Zum Schluss

KI-Transkription ist inzwischen beeindruckend gut, und trotzdem hängt die Qualität der Noten davon ab, was du hineingibst. Sauberes Audio, ein passendes Dateiformat, der richtige Instrumententyp vor dem Hochladen und ein kurzer Durchgang vor dem Export: Diese Reihenfolge gilt, egal was du transkribierst und was du danach mit den Noten vorhast.

Wenn du vor der Session die Pegel checkst, eine Aufnahme wählst, in der dein Instrument gut zu hören ist, und dir vor dem Export ein paar Minuten nimmst, um das Ergebnis zu prüfen, bleibt das Transkribieren schnell und zuverlässig.

Häufige Fragen

Wie bekomme ich genaue KI-Transkriptionen meiner Musik?

Das meiste entscheidet sich, bevor du hochlädst. Nimm im ruhigsten Raum auf, den du hast, denn die Aufnahmeumgebung beeinflusst die Genauigkeit stärker als alles andere. Danach speicherst du in einem verlustfreien Format, wählst den richtigen Instrumententyp und siehst das Ergebnis vor dem Export kurz durch. Je besser das Signal am Anfang ist, desto weniger musst du hinterher aufräumen.

Mit welchem Dateiformat wird die Transkription am besten?

Wenn du die Wahl hast, nimm WAV. Verlustfreie Dateien behalten die Frequenzdetails, die das Modell braucht, um benachbarte Tonhöhen auseinanderzuhalten und das Ausklingen der Töne zu verfolgen. MP3 mit hoher Bitrate reicht für die meisten Aufgaben. Bei niedrigeren Bitraten können aber Probleme auftauchen, also entscheide dich lieber für mehr Qualität als für eine kleinere Datei. Verlustbehaftete Formate werfen Informationen weg, die sich später nicht mehr zurückholen lassen.

Muss ich einen Song vor der Transkription in Stems aufteilen?

Meistens nicht. Die Modelle sind darauf trainiert, das ausgewählte Instrument herauszuhören, auch wenn andere Instrumente mitspielen. Bei den meisten fertigen Mixen kannst du den Song also so hochladen, wie er ist, dein Instrument wählen und das Trennen dem Modell überlassen. Geht dein Instrument in einer dichten Produktion unter, hilft eine aufgeräumtere Stelle oder eine klarere Aufnahme mehr als jede Vorbearbeitung.

Zur Person

Andrew Carlins

Geschrieben von

Andrew Carlins

Mitgründer und CEO von Songscription

Andrew hat Songscription in Stanford zusammen mit ein paar anderen Musiker:innen gegründet. Sie hatten es satt, die Noten zu den Songs, die sie spielen wollten, nirgends zu finden. Er ist mit Klavier und Baritonsaxofon aufgewachsen und stand in Musicals auf der Bühne. Das ist zwar schon Jahre her, aus dem Takt ist er nach eigener Einschätzung aber noch lange nicht. Hier schreibt er darüber, wie ein Song von der Aufnahme aufs Papier kommt.

Mehr über das Team

Hier findest du weitere Artikel zu denselben Themen.