scaleyour.ai
1 · Die große Landkarte

Transformer

die Architektur hinter LLMs

Auf einen Blick

Der Transformer ist die Netzwerk-Architektur hinter fast allen heutigen LLMs; ihr Kern ist der Attention-Mechanismus.

Was bedeutet Transformer?

Die Netzwerk-Architektur (Google-Paper „Attention Is All You Need“, 2017), auf der praktisch alle heutigen LLMs basieren. Kernidee: der Attention-Mechanismus — das Modell gewichtet für jedes Wort, welche anderen Wörter im Text gerade relevant sind, und erfasst so Zusammenhänge über lange Distanzen.

Abgrenzung — worauf es ankommt

Vorgänger (RNN/LSTM) lasen Text Wort für Wort sequenziell und „vergaßen“ weit Zurückliegendes. Transformer betrachten den ganzen Text parallel — deshalb sind sie leistungsfähiger und auf GPUs massiv parallelisierbar trainierbar.

Beispiel aus der Praxis

Im Satz „Die Bank am Fluss war aus Holz“ erkennt Attention aus „Fluss“ und „Holz“, dass „Bank“ die Sitzgelegenheit ist, nicht das Geldinstitut.

Zum Weiterdenken

Das „T“ in GPT steht für Transformer (Generative Pre-trained Transformer). GPT-artige Modelle nutzen nur den Decoder-Teil der Original-Architektur (autoregressiv: Token für Token erzeugen); BERT-artige Modelle nur den Encoder (Text verstehen/einbetten — so funktionieren auch die Embedding-Modelle im RAG-Kontext).

Transformer in Ihrem Unternehmen nutzen?

Von der Theorie in die Praxis: Wir zeigen Ihnen den passenden Weg — pragmatisch, DSGVO-konform und messbar.

Kostenlos · unverbindlich