Informatik: Daten & Kodierung

Akademie

Informatik: Daten & Kodierung

Information, Bit, Zahlensysteme und Zeichenkodierung.

Information, Bit und Zahlensysteme

Begriffe vorab

  • Bit: Kleinste Informationseinheit mit zwei Zuständen, 0 oder 1.
  • Byte: Gruppe von acht Bit.
  • Dualsystem: Zahlensystem zur Basis 2.
  • Hexadezimalsystem: Zahlensystem zur Basis 16 mit den Ziffern 0–9 und A–F.
  • Kodierung: Vorschrift, die Informationen als Bitfolgen darstellt.

Information und Bit

Claude Shannon veröffentlichte im Juli 1948 im Bell System Technical Journal die Arbeit „A Mathematical Theory of Communication“. Darin wird Kommunikation erstmals als mathematisches Problem behandelt; zur Messung von Information dient die Einheit Bit („binary digit“). Shannon schreibt, das Wort sei von J. W. Tukey vorgeschlagen worden. Ein Bit hat zwei mögliche Zustände – das lässt sich technisch leicht umsetzen, etwa als Spannung an oder aus.

Warum binär?

Zwei klar unterscheidbare Zustände sind in Schaltungen robust gegen Störungen. Alles Weitere – Zahlen, Texte, Bilder, Töne – wird als Folge von Bits kodiert. Welche Bedeutung eine Bitfolge hat, legt nicht die Folge selbst fest, sondern die Vereinbarung, mit der sie gelesen wird.

Zahlensysteme

Im Dezimalsystem hat jede Stelle den Wert einer Zehnerpotenz, im Dualsystem den einer Zweierpotenz. Beispiel: 1101 im Dualsystem bedeutet 1·8 + 1·4 + 0·2 + 1·1 = 13. Weil lange Bitfolgen unleserlich sind, nutzt man das Hexadezimalsystem: Vier Bit ergeben genau eine Hex-Ziffer. So wird aus 1111 1111 kurz FF (255).

Dezimal   Dual       Hexadezimal
  10      1010         A
  13      1101         D
 255      1111 1111    FF

Wie viel passt in n Bit?

Mit n Bit lassen sich 2n verschiedene Werte darstellen: 8 Bit ergeben 256 Werte (0–255), 16 Bit ergeben 65.536, 32 Bit etwa 4,3 Milliarden. Diese Zahl begegnet dir wieder bei IPv4-Adressen, die 32 Bit lang sind (siehe Netzwerklektionen).

Beispiel: Eine Farbe

Eine Bildschirmfarbe wird oft mit je einem Byte für Rot, Grün und Blau angegeben, etwa #1E90FF: 1E (30) Rot, 90 (144) Grün, FF (255) Blau. Die Schreibweise ist nur eine Vereinbarung – dieselben Bits könnten auch etwas ganz anderes bedeuten.

Bitfolgen haben keine Bedeutung an sich: Erst die Kodierung macht aus ihnen Zahlen, Text oder Bilder.

Zum Selbermachen

  1. Wandle die Zahlen 7, 42 und 200 ins Dualsystem und ins Hexadezimalsystem um.
  2. Berechne, wie viele verschiedene Werte 10 Bit darstellen können.

Verwandte Themen

Daten → „Zeichenkodierung“. Schichtenmodelle → in jeder Schicht werden Bitfolgen mit eigener Bedeutung versehen. Security → „Security: Netzwerk für Einsteiger“ (DNS, VPN, WLAN) und „Security: Grundlagen“ bauen auf diesem Wissen auf.

Prüfstatus: Belegt (Stand 1. Oktober 2026): Shannons Arbeit (Juli 1948, Bell System Technical Journal), die Einheit Bit und der Hinweis auf J. W. Tukey wurden gegen den Aufsatz und Fachberichte geprüft. Nicht einzeln belegt: die mathematischen Umrechnungen und das Farbbeispiel (Allgemeinwissen, nachrechenbar), die Begründung der binären Darstellung (didaktische Erklärung).

Quellen

  • Claude E. Shannon – „A Mathematical Theory of Communication“ (Bell System Technical Journal, Juli und Oktober 1948)

Zeichenkodierung: von ASCII zu UTF-8

Begriffe vorab

  • Zeichensatz: Menge von Zeichen, die jeweils eine Nummer erhalten.
  • Codepoint: Die Nummer eines Zeichens in Unicode, geschrieben als U+…
  • Zeichenkodierung: Vorschrift, wie Codepoints als Bytes gespeichert werden.
  • ASCII: Alter Zeichensatz mit 128 Zeichen.
  • UTF-8: Variable Kodierung für Unicode mit 1 bis 4 Bytes pro Zeichen.

Das Problem

Computer kennen nur Zahlen. Damit Text gespeichert und übertragen werden kann, muss jedes Zeichen eine Nummer erhalten (Zeichensatz) und diese Nummer muss als Bytes dargestellt werden (Kodierung). Früher gab es viele nationale Lösungen, die sich nicht miteinander vertrugen – deshalb erschienen deutsche Umlaute auf fremden Systemen als falsche Zeichen („Mojibake“).

ASCII und Unicode

ASCII umfasst 128 Zeichen mit 7-Bit-Nummern: Buchstaben ohne Umlaute, Ziffern, Satzzeichen und Steuerzeichen. Unicode ordnet Zeichen aller Schriften Nummern (Codepoints) zu, etwa U+0041 für „A“ und U+00E4 für „ä“.

UTF-8

UTF-8 ist die im Web verbreitetste Kodierung. Sie wurde im November 2003 in RFC 3629 festgelegt und kann alle gültigen Unicode-Codepoints (1.112.064 Stück) mit einem bis vier Bytes darstellen. Das Besondere: Die Zeichen U+0000 bis U+007F (also ASCII) werden mit einem Byte und identisch zur ASCII-Kodierung gespeichert. Reiner ASCII-Text ist deshalb zugleich gültiger UTF-8-Text.

Zeichen  Codepoint  UTF-8 (hex)   Bytes
A        U+0041     41            1
ä        U+00E4     C3 A4         2
€        U+20AC     E2 82 AC      3
😀       U+1F600    F0 9F 98 80   4

Typische Fehler

  • Falsch gelesene Kodierung: Ein UTF-8-Text wird als ISO-8859-1 interpretiert: „ä“ erscheint als „ä“.
  • Zeichen gleich Byte annehmen: In UTF-8 ist die Länge in Bytes nicht die Länge in Zeichen.
  • Fehlende Angabe: Webseiten, Datenbanken und Dateien sollten ihre Kodierung ausdrücklich nennen.

Beispiel: Ein Webformular

Ein Nutzer gibt „Müller“ in ein Formular ein. Der Browser sendet UTF-8, der Server liest es als UTF-8, die Datenbank speichert es als UTF-8. Gibt eine Station falsch an, wie gelesen wird, entsteht „Müller“. Das Prinzip „an jeder Schicht dieselbe Vereinbarung“ ist ein Vorgeschmack auf Schichtenmodelle.

Lege für ein Projekt eine einzige Kodierung fest – UTF-8 – und nenne sie überall ausdrücklich.

Zum Selbermachen

  1. Öffne eine Textdatei mit einem Hex-Editor und finde die Bytes für „ä“.
  2. Speichere einen Text mit Umlauten einmal als UTF-8 und einmal als ISO-8859-1 und öffne beide mit falscher Einstellung.

Verwandte Themen

Daten → „Information, Bit und Zahlensysteme“. Webentwicklung → WordPress speichert Inhalte in Datenbanken; falsche Kodierungen führen dort zu typischen Darstellungsfehlern.

Prüfstatus: Belegt (Stand 1. Oktober 2026): UTF-8 nach RFC 3629 (November 2003), 1 bis 4 Bytes, 1.112.064 gültige Codepoints und die Gleichheit von ASCII und UTF-8 für U+0000 bis U+007F wurden gegen RFC-Verzeichnisse und Fachquellen geprüft. Nicht einzeln belegt: die Beispielbytes (nachrechenbar nach der UTF-8-Regel), die Angabe „128 Zeichen“ für ASCII (Allgemeinwissen, hier nicht gegen die Norm geprüft) und die Fehlerbilder (typische Praxis).

Quellen

  • IETF – RFC 3629 „UTF-8, a transformation format of ISO 10646“ (November 2003)
  • Unicode Consortium – „The Unicode Standard“ (unicode.org)