FAQ zur Richtlinie zum Umgang mit Forschungsdaten an der LUH

Eine leuchtende Glühbirne Eine leuchtende Glühbirne Eine leuchtende Glühbirne © Sergei Akulich | Pixabay

Richtlinie zum Umgang mit Forschungsdaten

Forschungsdaten haben eine große Bedeutung im wissenschaftlichen Erkenntnisprozess. Wesentliche Prinzipien für einen professionellen Umgang mit diesen Daten sind daher vielfach in Policies auf verschiedenen Ebenen festgelegt, von einzelnen Verbundprojekten bis zu internationalen Forschungsorganisationen. An der LUH sind Grundsätze zu den Anforderungen und Verantwortlichkeiten beim Datenmanagement auf institutioneller Ebene in der "Richtlinie zum Umgang mit Forschungsdaten an de LUH" formuliert. Auf dieser Seite haben wir dazu ergänzende Erklärungen und Informationen zusammengestellt.

Datenbeschreibung und -dokumentation

  • Was sind Forschungsdaten?

    Forschungsdaten sind Daten, die im Verlauf eines wissenschaftlichen Arbeitsprozesses erzeugt und verarbeitet werden. Sie bilden die Grundlage von Forschungsergebnissen. Dabei kann es sich um sehr unterschiedliche Arten von Daten handeln, z.B. um Messergebnisse, Sekundäranalysen, Visualisierungen, Modelle oder die Resultate von Umfragen und Erhebungen. Ebenso vielfältig sind die möglichen Datei-Formate, um Zahlen, Text, Programmcode oder Grafiken zu speichern. Mitunter werden sogar physische Proben wie Mineralien oder Gewebe als "Daten" definiert.

  • Welche Dateiformate sind mit den FAIR-Prinzipien vereinbar?

    Von der Art der Daten und ihren Dateiformaten hängt ab, ob und wie sie automatisch weiterverarbeitet werden können, wie kompatibel sie mit anderen Hard- und Softwaresystemen sind (Interoperable) und ob sie langfristig lesbar bleiben (Re-usable). Die Dateiformate sollten daher möglichst offen und weit verbreitet sein.  

    Einige Geräte und viele Anwendungsprogramme speichern Daten jedoch standardmäßig in einem Hersteller-spezifischen Format, das nur mit spezieller Software lesbar ist. Prüfen Sie in diesen Fällen die Möglichkeit, die Daten in ein offenes Format zu exportieren oder zu konvertieren, um die Interoperabilität zu erhöhen.

    Empfehlungen zu Dateiformaten finden Sie unter anderem auf der Homepage der Landesinitiative Langzeitverfügbarkeit des Landes Nordrhein-Westfalen.

  • Wie sieht eine gute Dateibenennung und Ordnerstruktur aus?

    Ordner- und Dateinamen sollten aus Elementen bestehen, die eine schnelle Einordnung des Inhalts erlauben. Sie können beispielsweise Auskunft über das Erstellungsdatum, die Dateiversion und die bearbeitende Person geben. Diese Elemente sollten ein einheitliches Format haben und in gleichbleibender Reihenfolge verkettet werden. Achten Sie darauf, dass Benennungskonventionen im Vorfeld vereinbart, schriftlich fixiert und während des Forschungsprozesses eingehalten werden.

    Je mehr Informationen Dateinamen enthalten desto länger können sie werden. Da einige Programme sehr lange Dateinamen nicht verarbeiten können, bietet es sich an, die Teile der Information, die für alle Dateien in einem Ordner gleich sind, stattdessen im Ordnernamen abzubilden.

    Tipps für die Dateibenennung

    • Datumsangaben im Format JJMMTT, also z.B. 150828 für den 28. August 2015
    • Personenangaben verkürzen, z.B. auf Initialen
    • Nutzen Sie nur folgende Zeichen für Dateinamen: A-Z a-z 0-9 _ (Unterstrich)
    • Verwenden Sie keine Umlaute, Leerzeichen oder Sonderzeichen, denn viele Programme erkennen diese Zeichen nicht als Teil des Dateinamens oder stellen sie nicht korrekt dar
  • Was ist mit Dokumentation von Daten gemeint? Was sind Metadaten?

    Wenn Sie für Ihre Forschung Daten sammeln, erheben und verarbeiten, sollten Sie stets dokumentieren, woher sie stammen oder wie sie erzeugt wurden und welche Verarbeitungsschritte sie durchlaufen. Strukturierte Informationen zur Dokumentation und Beschreibung von Forschungsdaten sind Metadaten. Dazu gehören zum Beispiel Angaben zum Forschungskontext und zu technischen Eigenschaften. Im Projektverlauf können Metadaten auf unterschiedliche Weise gesammelt werden, z.B.:

    • in einer Datenbank
    • in einem elektronischen Laborbuch
    • in einem Git (Versionsverwaltung)
    • in Tabellen (z.B. Excel)
    • in Readme-Dateien (Text, PDF)
    • in einer strukturierten XML- oder JSON-Datei
    • integriert in den Daten-Dateien (z.B. im Fileheader)

    Durch eine gute und strukturierte Dokumentation, inklusive der Erfassung von Metadaten, werden die Daten...

    • besser auffindbar (auch maschinell, z. B. durch Suchmaschinen)
    • besser (oder überhaupt erst) verstehbar und damit nachnutzbar
    • zitierfähig und damit dem Ersteller der Daten zuzuordnen
    • wertvoller für die Wissenschaft, da Inhalte, Qualität und Bearbeitungsstand besser eingeschätzt werden können 

    Diese grundlegenden deskriptiven Metadaten sollten bei einer Veröffentlichung von Daten möglichst immer mit hinterlegt werden:

    • Eindeutiger Identifier (z.B. ein DOI)
    • Titel des Datensatzes
    • Ersteller:in (hauptverantwortlich Forschende)
    • Erhebungsdatum (auch Versionen)
    • Format (ggf. benötigte Software)
    • Fachgebiet
    • Beschreibung der Daten / Abstract
    • Erfassung der Daten (räumlich / zeitlich)
    • Organisation
    • Rechte / Lizenzbestimmungen
    • Beziehung zu anderen Objekten (Daten, Texte...)

    Metadatenschemata legen das genaue Format dieser Informationen fest, um die maschinelle Verarbeitung zu erleichtern. Besonders weit verbreitete allgemeine (generische) Standards sind DataCite und Dublin Core. Mehr Information zum Thema finden Sie z.B. bei forschungsdaten.info

  • Was sollte in einem Datenmanagementplan stehen?

    Die Planungen zum Umgang mit Forschungsdaten sollten zu Beginn des Forschungsprozesses in einem Datenmanagementplan (DMP) festgehalten werden. Inhalt eines DMP sind vor allem:

    • Administrative Angaben zum Forschungsprojekt
    • Welche Daten werden in meinem Projekt verwendet? (Selber generierte Daten, bereits existierende Daten)
    • Wie und wo werden die Daten gespeichert? (Dateinamen, Speicherorte, Backups)
    • Wie und womit werden Daten und ihre Verarbeitung dokumentiert? (Dokumentationssysteme, Metadatenstandards)
    • Wie werden die Daten aufbereitet? (Tools und Methoden)
    • Welche rechtlichen und ethischen Aspekte müssen beachtet werden? (Datenschutz, Nutzungsrechte)
    • Wie werden Daten zugänglich gemacht? (Archive, Repositorien, PID, Lizenzen, ggf. Zugangsbeschränkungen)
    • Wer übernimmt im Projekt beim Datenmanagement welche Aufgaben und trägt dafür die Verantwortung?
    • Welche Ressourcen stehen für das Datenmanagement zur Verfügung? (Geld, Infrastruktur, Personal, Zeit)

    Generell sollten Sie einen Datenmanagementplan für den projektinternen Gebrauch möglichst ausführlich formulieren. Passen Sie ihn entsprechend an, wenn der Forschungsprozess von der ursprünglichen Planung abweicht oder bestimmte Aspekte konkretisiert werden sollen. Unsere detaillierten Empfehlungen zu Aufbau und Inhalt von DMP finden Sie hier. Auf der Unterseite "Tools" finden Sie außerdem online-Dienste, die Sie beim Ausarbeiten eines DMP unterstützen können.

    Weiterführende Informationen

  • Welche rechtlichen Aspekte sind zu beachten?

    Bevor Sie wissenschaftliche Daten erheben, verarbeiten und veröffentlichen, sollten Sie die rechtlichen Rahmenbedingungen und Vorgaben für den Umgang mit Forschungsdaten prüfen. Personenbezogene Daten unterliegen zum Beispiel den Datenschutzgesetzen. Wenn Sie Daten verarbeiten, die von anderen Personen oder Institutionen erhoben wurden, prüfen Sie im Vorfeld, ob und unter welchen Bedingungen deren Nutzung erlaubt ist. Wurden die Daten vielleicht unter speziellen Lizenzen veröffentlicht? Klären Sie außerdem mit Ihrem Arbeitgeber, welche Verwertungsrechte Sie an den von Ihnen erhobenen Daten haben. Wenn Sie gemeinsam mit anderen Daten erzeugen, treffen Sie am besten vorab gemeinsam schriftliche Vereinbarungen dazu, wer welche Daten in welcher Form nutzen darf. Ausführliche Informationen, Anlaufstellen und weiterführende Links zu rechtlichen und ethischen Fragen finden Sie hier.

Speichern, Archivieren und Publizieren

  • Wie können Daten vor Verlust geschützt werden?

    Der Verlust Ihrer unter Kosten-, Zeit- und Arbeitsaufwand erhobenen Daten und der darauf aufbauenden Analysen kann erhebliche negative Folgen für Ihre Forschung haben. Ein (möglichst tägliches) automatisiertes Backup auf Speichermedien, die sich mindestens in einem anderen Gebäude als das Original befinden, ist daher essenziell.

    In einem laufenden Projekt nutzen Sie für die Datenablage nach Möglichkeit Institutsserver, deren Daten über den Dienst Backup & Restore- Dienst des LUIS automatisch täglich gesichert werden. Alternativ steht Ihnen im Rahmen der LUIS-Projektablage mit “Projekt-Seafile” ein Cloudspeicher zur Verfügung, der ebenfalls täglich automatisch gesichert wird. Weitere Infos zum Thema finden Sie bei forschungsdaten.info.

  • Wie können sensible Daten technisch vor unbefugtem Zugriff geschützt werden?

    Arbeiten Sie mit schutzwürdigen Daten, sollten Sie den Zugang sowie die Lese- und Schreibberechtigungen auf den unmittelbaren Kreis der Mitarbeitenden einschränken. Solche Beschränkungen lassen sich zum Beispiel über Gruppenrichtlinien auf Dateisystem-Ebene oder entsprechende Einstellmöglichkeiten von Dateidiensten wie dem vom LUIS angebotenen Projekt-Seafile festlegen. Kostenlose kommerzielle Cloud-Speicherdienste und unverschlüsselte USB-Medien sind kein geeigneter Ort für schützenswerte Daten. 

    Personenbezogene Forschungsdaten müssen Sie aus Gründen des Datenschutzes grundsätzlich verschlüsselt speichern. Sie können ganze Dateisysteme von Massenspeichern wie Festplatten und tragbaren USB-Medien verschlüsseln, sodass Unbefugte sie nicht auslesen können (Datenträgerverschlüsselung). Die meisten Betriebssysteme wie macOS, Windows und Linux bringen dazu bereits Software mit (FileFault, Bitlocker, dm-crypt). Eine gute Alternative ist das quelloffene Programm VeraCrypt. Damit können Sie neben ganzen Laufwerken und Partitionen auch einzelne Ordner und Dateien direkt verschlüsseln. Letzteres funktioniert auch mit etlichen Archivmanagern (z.B. 7-Zip). Mit Cryptomator können Sie verschlüsselte Dateicontainer anlegen, die dann wiederum auch in Cloudspeichern wie dem Projekt-Seafile sicher abgelegt werden können. Weitere Informationen finden Sie auf der LUIS-Seite zum Thema Datenverschlüsselung.

  • Wo und wie können Daten entsprechend der FAIR-Prinzipien archiviert und publiziert werden?

    Gemäß der guten wissenschaftlichen Praxis müssen Forschungsdaten, die einem veröffentlichten Forschungsergebnis zugrunde liegen, zu Nachweiszwecken für mindestens zehn Jahre aufbewahrt werden. Dafür können sie in einem professionellen Datenarchiv abgelegt werden. Für LUH-Angehörige stellt das LUIS ein solches Datenarchiv bereit.

    Sofern keine rechtlichen oder ethischen Gründe entgegenstehen, sollten Daten aber nicht nur aufbewahrt, sondern möglichst offen zugänglich gemacht werden. Zu diesem Zweck können sie in ein Forschungsdatenrepositorium oder Datenzentrum geladen werden. Die dort veröffentlichten Daten können dann auch von Dritten genutzt und zitiert werden. Die meisten Repositorien haben spezielle Anforderungen an die Daten, die bestenfalls bereits vor der Datenerstellung bedacht und berücksichtigt werden sollten. Üblicherweise sind das einige oder alle der folgenden Anforderungen:

    • Verwendung offener Datenformate, die die langfristige Archivierung und den Zugriff erleichtern
    • Angabe von Pflicht-Metadaten zur Dokumentation, um Auffindbarkeit und Nutzbarkeit zu erhöhen
    • Versicherung, dass Archivierung und Zugriff auf die Daten nicht gegen das Urheberrecht oder den Datenschutz verstoßen.
    • Vergabe einer Lizenz mit klaren Regelungen zur Nachnutzung der Daten durch Dritte

    Das LUIS betreibt ein institutionelles Datenrepositorium. Sofern vorhanden, sollten aber bevorzugt fachspezifische Repositorien genutzt werden. Eine Übersicht existierender Datenrepositorien finden Sie unter www.re3data.org.   

    Worauf Sie bei der Wahl eines Repositoriums achten sollten

    • Garantierte Datenaufbewahrung für mindestens 10 Jahre
    • Erfassung von Metadaten zu jedem Datensatz, die mindestens den Standards DataCite oder Dublin Core entsprechen
    • Vergabe eindeutiger, langfristig gültiger Identifier für jeden hochgeladenen Datensatz (z.B. eines DOI)
  • Welche Daten sollten publiziert werden?

    Viele Förderer, Universitäten und Wissenschaftsorganisationen empfehlen oder verlangen, Forschungsdaten frei zugänglich zu machen. Dadurch sind einerseits die publizierten Auswertungen besser überprüfbar. Andererseits wird eine Nachnutzung durch Dritte ermöglicht.

    In der Regel ist es jedoch weder möglich noch sinnvoll, sämtliche im Forschungsprozess entstandene Daten zu publizieren. Ein wichtiger Schritt ist daher die Auswahl der publikationswürdigen Daten, die der/die Forschende selbst trifft. Wir empfehlen die Publikation aller Daten, die mindestens eines der folgenden Kriterien erfüllen:

    • Einzigartigkeit: Es sind keine Dubletten der Daten bereits an anderer Stelle veröffentlicht.
    • Stark eingeschränkte Reproduzierbarkeit: Die Daten könnten nicht oder nur unter sehr großem Aufwand erneut generiert werden.
    • hohe fachliche Relevanz: Die Daten sind für Ihre Fachcommunity oder sogar fachübergreifend von besonderem Interesse.
    • Grundlage von Textpublikationen: Sie haben Bücher oder Artikel veröffentlicht, die auf der Auswertung dieser Daten basieren.

    Damit Ihre Daten auch tatsächlich nachgenutzt werden können, beachten Sie bitte Folgendes:

    • Adäquate Dokumentation: Stellen Sie ausreichend beschreibende Metadaten bereit, damit der Datensatz verständlich ist und gezielt in einer Datenbank (z.B. eines Repositoriums) gesucht werden kann.
    • Lesbarkeit: Speichern Sie die Daten nach Möglichkeit in offenen, weit verbreiteten Formaten, die plattformunabhängig geöffnet werden können und keine spezielle (evtl. nicht dauerhaft verfügbare) Hard- und Software benötigt.
    • Rechte: Prüfen Sie, ob ggf. Rechte Dritter einer Veröffentlichung entgegenstehen (z.B. Urheber-, Datenschutz- oder Persönlichkeitsrechte). Falls das der Fall ist, versuchen Sie, sich alle notwendigen Rechte von den Betroffenen schriftlich einräumen zu lassen. Versehen Sie Ihre Daten mit einer offenen Lizenz (z.B. CC0), damit sie uneingeschränkt nachgenutzt werden dürfen.
  • Welche Lizenzen werden empfohlen?

    Mit der Vergabe einer Lizenz legen Urheber:innen fest, unter welchen Bedingungen Dritte die Daten nachnutzen dürfen. Wir empfehlen, möglichst offene Lizenzen für Datenpublikationen zu verwenden, die eine Nachnutzung nicht oder kaum einschränken. Andere Personen könne die Daten nach eigenem Ermessen verwenden, verändern und weiterverbreiten. Es gibt auch Lizenzen, die diese Rechte einschränken. Diese gelten dann aber nicht mehr als "offen". Die Vergabe einer standardisierten Lizenz ist in der Regel eine Voraussetzung für die Publikation von Daten in einem Repositorium.

    Empfohlene Lizenzen

Richtlinien und Projektplanung

Einbindung von FDM-Themen in die Lehre