Skip to main content

12.11 Unicode

Definition

Unicode ist ein internationaler Standard zur Darstellung von Zeichen aus vielen Sprachen und Schriftsystemen.

Unicode erweitert die Möglichkeiten älterer Zeichencodierungen wie ASCII.


Ziel

Unicode soll möglichst alle weltweit verwendeten Zeichen eindeutig darstellen.

Dazu gehören:

  • Buchstaben
  • Ziffern
  • Sonderzeichen
  • Symbole
  • Schriftzeichen verschiedener Sprachen
  • Emojis

Wichtige Begriffe

Begriff Bedeutung
Unicode Standard für Zeichen
Codepoint eindeutige Nummer eines Zeichens
UTF-8 Codierung für Unicode-Zeichen
UTF-16 Codierung für Unicode-Zeichen
UTF-32 Codierung mit fester Länge

UTF-8

UTF-8 ist eine weit verbreitete Codierung für Unicode.

Eigenschaften:

  • kompatibel zu ASCII
  • variable Zeichenlänge
  • häufig im Web verwendet
  • speichereffizient bei lateinischen Zeichen

Vergleich ASCII und Unicode

ASCII Unicode
7 Bit deutlich größerer Zeichenvorrat
128 Zeichen sehr viele Zeichen
hauptsächlich englische Zeichen internationale Zeichen
keine Umlaute im ursprünglichen ASCII Umlaute und Sonderzeichen möglich

Merksatz

Unicode ist der Standard für internationale Zeichen.
UTF-8 ist eine Codierung für Unicode.


Prüfungshinweis

In IHK-Aufgaben wird häufig zwischen ASCII, Unicode und UTF-8 unterschieden.

Typische Fehler:

  • Unicode und UTF-8 gleichsetzen.
  • ASCII und Unicode verwechseln.
  • Codepoint und Codierung verwechseln.
  • Umlaute im ursprünglichen ASCII erwarten.

Quellen

  • IT-Handbuch für Fachinformatiker
  • The Unicode Standard