Transformer
Auch: Transformer-Architektur, Attention
Der Transformer ist eine 2017 vorgestellte Architektur neuronaler Netze, die auf Aufmerksamkeitsmechanismen beruht und die Grundlage heutiger Sprachmodelle bildet.
Der Transformer ist eine Architektur für neuronale Netze, die Forscher von Google 2017 im Aufsatz „Attention Is All You Need“ vorstellten. Statt Texte Wort für Wort nacheinander zu verarbeiten, nutzt er einen Aufmerksamkeitsmechanismus (Attention), der die Beziehungen zwischen allen Wörtern eines Textes gleichzeitig gewichtet. Das „T“ in GPT steht für Transformer.
Bedeutung für KI-Sichtbarkeit
Große Sprachmodelle wie GPT, Claude und Gemini bauen auf dieser Architektur auf. Sie verarbeiten Texte in Tokens innerhalb eines begrenzten Kontextfensters. Klar gegliederte Texte mit eindeutigen Aussagen lassen sich dabei leichter verarbeiten und korrekt wiedergeben, siehe Content für KI schreiben.
Häufige Fragen
Wer hat den Transformer erfunden?
Ein Team um Ashish Vaswani, damals überwiegend bei Google, im Jahr 2017.
Nutzen alle Sprachmodelle Transformer?
Die bekannten großen Sprachmodelle beruhen darauf, oft mit eigenen Weiterentwicklungen.