Aktueller Stand des JupyterHub des CMS der HU Berlin

Zur Unterstützung des wissenschaftlichen und didaktischen Einsatzes von Jupyter-basierten Arbeitsumgebungen wurde in den vergangenen vier Jahren im Rahmen des Projekts AI-Skills ein Jupyterhub aufgebaut, der mittlerweile als Teil der digitalen Infrastruktur für Lehre und Forschung zentral durch den Computer- und Medienservice (CMS) der Humboldt-Universität zu Berlin (HU Berlin)1 betrieben wird. Die Plattform ermöglicht es Studierenden, Lehrenden und Forschenden, Notebooks in Python-, R- oder anderen Sprachen direkt im Browser zu erstellen, auszuführen und zu teilen, ohne dass eine lokale Installation von Software erforderlich ist. Damit eignet sie sich besonders für den Einsatz in der Datenanalyse, Statistik, beim maschinellen Lernen und der wissenschaftlichen Programmierung. Mit Blick auf die Anforderungen von Lehrveranstaltungen, Projekten und wissenschaftlichen Arbeiten konzipiert, ermöglicht der Jupyterhub der HU Berlin den gemeinsamen Zugriff auf geteilte Ressourcen sowie die Dokumentation von Arbeitsabläufen. Die isolierte und sichere Ausführung von Notebooks wird durch Containerisierung gewährleistet.

Für das Sommersemester 2026 wurden ausgewählte JupyterLab Images aktualisiert. Die Umgebungen sind als Docker-Container konfiguriert und werden in einem Kubernetes-Cluster bereitgestellt. Die Nutzung von GPU-Ressourcen ist bei einigen dieser Images über einen NVIDIA A100-Cluster (insgesamt 12 Server) möglich. Im Folgenden werden diese Images vorgestellt.

Für statistische Analysen und die Modellentwicklung mit R, die Erstellung von R-Paketen und Shiny-Anwendungen oder die Arbeit mit R-Markdown steht das R JupyterLab Image bereit. Es enthält eine vollständige R-Installation mit einer Reihe von Standard-Paketen (caret, devtools, shiny, tidymodels oder rmarkdown) für die Datenverarbeitung. Außerdem integriert es die von Posit bereitgestellte IDE Positron2. Diese bietet eine browserbasierte Entwicklungsumgebung mit integrierter R-Konsole, Variablen-Explorer, Plot-Viewer und Debugging-Unterstützung.

Das dhvision JupyterLab Image ist eine JupyterLab-Umgebung für die digitale Bildwissenschaft. Sie eignet sich für Anwendungen wie Objektdetektion und -segmentierung auf historischen Fotografien und Filmstills, semantische Bildsuche mittels Embeddings, Transfer-Learning auf benutzerdefinierten Datensätzen sowie Szenenerkennung in der Filmanalyse.

Das JupyterLab Image läuft mit GPU-Unterstützung und stellt zwei Kernel bereit:

  • dhvision-main (Python 3.11): z. B. zur Implementierung einfacher Convolutional Neural Networks oder Objektdetektion
  • dhvision-sam3 (Python 3.12): für die Nutzung bspw. von Meta’s SAM 3 mit promptbasierter Segmentierung


Vortrainierte Modellgewichte sind zentral auf einem read-only NFS-Share bereitgestellt.

Das NLP JupyterLab Image stellt eine vorkonfigurierte Umgebung für Forschung und Lehre im Bereich der maschinellen Sprachverarbeitung bereit. Es kombiniert klassische NLP-Werkzeuge mit modernen Transformer-basierten Architekturen. Für traditionelle NLP-Aufgaben sind Bibliotheken wie spaCy (mit vorkonfigurierten Modellen für Deutsch und Englisch), NLTK, flair, stanza, cltk und gensim verfügbar. Für die Arbeit mit großen Sprachmodellen sind Hugging-Face-Modelle über die transformers-Bibliothek zugänglich. Zusätzlich sind Frameworks für Retrieval-Augmented Generation (RAG), wie LangChain, LlamaIndex und Haystack, sowie Tools für hochdurchsatzfähige Inferenz und speichereffizientes Fine-Tuning integriert.

Über ein Drop-Down-Menü in der Profilliste von Jupyterhub lässt sich anhand der Anforderungen das Hardware-Profil für das NLP Image auswählen (siehe Grafik).

Für rechenintensive Aufgaben im Bereich des maschinellen Lernens und der Datenanalyse steht mit dem CUDA JupyterLab Image von Christoph Schranz von der Universität Salzburg3 eine GPU-fähige JupyterLab-Umgebung bereit. Lehrveranstaltungen und Forschungsprojekten, die auf GPU-beschleunigtes Rechnen angewiesen sind, dient es als stabile und gut gepflegte Grundlage. Basierend auf dem NVIDIA CUDA Toolkit stellt es wissenschaftliche Bibliotheken wie NumPy, pandas, scikit-learn und PyTorch zur Verfügung.

Das JupyterLab AI Image erweitert die standardmäßige Datascience Notebook-Umgebung um einen KI-Chat mit der Jupyternaut-Persona. Diese Funktion eignet sich für die Unterstützung bei der Code-Erstellung, dem Debugging und der Bearbeitung datenanalytischer Fragestellungen in Python, R oder SQL.

Die zugrundeliegenden Sprachmodelle werden intern gehostet und sind speziell für Code-Generierung und -Erklärung optimiert. Die Kommunikation erfolgt ausschließlich über einen internen Endpunkt. Daten werden nicht an externe Dienste übertragen.

Alle Images sind über die JupyterHub-Startseite bzw. über eine LTI-Schnittstelle auch über Moodle zugänglich. Die Auswahl der gewünschten Umgebung erfolgt nach der Anmeldung über die Profilliste. Persistentes Speichern von Daten und Umgebungen erfolgt über das jeweilige Home-Verzeichnis, das über ein NFS-Share bereitgestellt wird.

Bei technischen Fragen, Anregungen zur Nutzung oder dem Bedarf nach einem eigenen JupyterLab Image können Sie sich jederzeit an den Support für JupyterHub wenden. Weitere Informationen zu dem Dienst finden Sie auf den Seiten des CMS4.

  1. https://jupyterhub.hu-berlin.de ↩︎
  2. https://positron.posit.co ↩︎
  3. https://github.com/iot-salzburg/gpu-jupyter ↩︎
  4. https://www.digitale-lehre.hu-berlin.de/de/lehr-und-lernlandschaft/jupyterhub ↩︎
24. August 2026 | Veröffentlicht von cmsredakteur
Veröffentlicht unter CMS-Broschüre 02/26

Schreiben Sie einen Kommentar

(erforderlich)