Jan Leike

Jan Leike (* 1986 oder 1987)[1] ist ein deutscher Informatiker und Forscher auf dem Gebiet der Künstlichen Intelligenz, insbesondere der KI-Alignmentfo

Jan Leike (* 1986 oder 1987)[1] ist ein deutscher Informatiker und Forscher auf dem Gebiet der Künstlichen Intelligenz, insbesondere der KI-Alignmentforschung und KI-Sicherheit. Er arbeitete unter anderem bei DeepMind und OpenAI und wechselte im Mai 2024 zum KI-Unternehmen Anthropic.[2][3]

Leben

Ausbildung

Leike studierte zunächst an der Albert-Ludwigs-Universität Freiburg. Nach einem Masterabschluss in Informatik promovierte er an der Australian National University bei Marcus Hutter im Bereich Maschinelles Lernen.[4][5] Nach seiner Promotion absolvierte Leike ein sechsmonatiges Postdoc-Fellowship am Future of Humanity Institute der University of Oxford. Anschließend wechselte er zu DeepMind, wo er im Bereich empirische KI-Sicherheit arbeitete und unter anderem mit Shane Legg kooperierte.[4][1]

Leike veröffentlichte mehrere Arbeiten zur Sicherheit und Ausrichtung lernender Systeme. Gemeinsam mit Paul Christiano, Tom B. Brown, Miljan Martic, Shane Legg und Dario Amodei untersuchte er 2017 das Lernen komplexer Ziele aus menschlichen Präferenzen im Reinforcement Learning.[6] Im selben Jahr gehörte er zu den Autoren von AI Safety Gridworlds, einer Sammlung von Testumgebungen zur Untersuchung von Sicherheitsproblemen bei KI-Agenten.[7]

OpenAI

Im Jahr 2021 wechselte Leike zu OpenAI. Dort war er an Arbeiten zur Ausrichtung großer Sprachmodelle beteiligt. Er gehörte zu den Mitautoren der 2022 veröffentlichten Arbeit zu InstructGPT, in der OpenAI zeigte, wie Sprachmodelle durch überwachte Finetuning und Reinforcement Learning from Human Feedback stärker an menschlichen Anweisungen ausgerichtet werden können.[8]

Im Juli 2023 stellte OpenAI das Projekt Superalignment vor, das sich mit der technischen Ausrichtung zukünftiger, dem Menschen überlegener KI-Systeme befassen sollte. Leike leitete das Projekt gemeinsam mit Ilya Sutskever. OpenAI erklärte, für die Arbeiten über vier Jahre hinweg 20 Prozent der bis dahin gesicherten Rechenressourcen des Unternehmens bereitstellen zu wollen.[9] Das Projekt sollte unter anderem untersuchen, wie fortgeschrittene KI-Systeme selbst zur Unterstützung der Alignment-Forschung eingesetzt werden können.[10]

Im Mai 2024 kündigte Leike seinen Rücktritt bei OpenAI an, kurz nachdem auch Sutskever das Unternehmen verlassen hatte. Leike erklärte, er habe über längere Zeit mit der Führung von OpenAI über die Prioritäten des Unternehmens gestritten und allmählich das Vertrauen verloren. Er kritisierte, Sicherheitskultur und Sicherheitsprozesse seien gegenüber „glänzenden Produkten“ in den Hintergrund getreten.[11][12] Auch deutschsprachige Fachmedien griffen Leikes Vorwürfe auf.[3][13]

Anthropic

Ende Mai 2024 wurde bekannt, dass Leike zu Anthropic wechselte, einem von ehemaligen OpenAI-Mitarbeitern gegründeten KI-Unternehmen. Dort sollte er ein neues Team für KI-Sicherheit und Kontrollierbarkeit leiten.[3][13][14] Nach eigenen Angaben leitet Leike bei Anthropic das Alignment Science-Team, das sich mit der Steuerung und Kontrolle zukünftiger leistungsfähiger KI-Systeme sowie mit der Bewertung entsprechender Risiken befasst.[2][15]

Forschung

Leikes Forschung befasst sich vor allem mit der Frage, wie KI-Systeme so trainiert werden können, dass sie menschlichen Absichten auch bei komplexen oder schwer überprüfbaren Aufgaben folgen. Zu seinen Themen zählen skalierbare Aufsicht, Reward Modeling, Robustheit gegen Fehlverhalten und die Automatisierung von Alignment-Forschung.[2][16]

Das Magazin Time nahm Leike 2023 und 2024 in seine Liste der 100 einflussreichsten Personen im Bereich Künstliche Intelligenz auf.[1][17]

Einzelnachweise

  1. a b c TIME100 AI 2023: Jan Leike. In: Time. 7. September 2023, abgerufen am 19. Juni 2026 (englisch).
  2. a b c Jan Leike. In: jan.leike.name. Abgerufen am 19. Juni 2026 (englisch).
  3. a b c Matthias Bastian: OpenAIs ehemaliger Super-KI-Sicherheitschef Jan Leike wechselt zur Konkurrenz. In: The Decoder. 28. Mai 2024, abgerufen am 19. Juni 2026.
  4. a b An AI safety researcher on how to become an AI safety researcher. In: 80,000 Hours. Abgerufen am 19. Juni 2026 (englisch).
  5. Michael Kroker, Kristin Rau: KI: Nicole Büttner, Elias Schneider und Jan Leike setzen auf Künstliche Intelligenz. In: wiwo.de. 7. Dezember 2024, abgerufen am 19. Juni 2026.
  6. Paul Christiano, Jan Leike, Tom B. Brown, Miljan Martic, Shane Legg, Dario Amodei: Deep reinforcement learning from human preferences. 17. Februar 2023, abgerufen am 19. Juni 2026.
  7. Jan Leike, Miljan Martic, Victoria Krakovna, Pedro A. Ortega, Tom Everitt, Andrew Lefrancq, Laurent Orseau, Shane Legg: AI Safety Gridworlds. In: arxiv.org. 28. November 2017, abgerufen am 19. Juni 2026 (englisch).
  8. Long Ouyang, Jeff Wu, Xu Jiang, Diogo Almeida, Carroll L. Wainwright, Pamela Mishkin, Chong Zhang, Sandhini Agarwal, Katarina Slama, Alex Ray, John Schulman, Jacob Hilton, Fraser Kelton, Luke Miller, Maddie Simens, Amanda Askell, Peter Welinder, Paul Christiano, Jan Leike, Ryan Lowe: Training language models to follow instructions with human feedback. In: arxiv.org. 4. März 2022, abgerufen am 19. Juni 2026 (englisch).
  9. Jan Leike, Ilya Sutskever: Introducing Superalignment. OpenAI, 5. Juli 2023, abgerufen am 19. Juni 2026 (englisch).
  10. Jan Leike on OpenAI’s massive push to make superintelligence safe in 4 years or less. In: 80,000 Hours. 7. August 2023, abgerufen am 19. Juni 2026 (englisch).
  11. Sigal Samuel: “I lost trust”: Why the OpenAI team in charge of safeguarding humanity imploded. In: Vox. 17. Mai 2024, abgerufen am 19. Juni 2026 (englisch).
  12. Dan Milmo: OpenAI putting ‘shiny products’ above safety, says departing researcher. In: The Guardian. 18. Mai 2024, abgerufen am 19. Juni 2026 (englisch).
  13. a b Ex-OpenAI-Forscher Jan Leike wechselt zu Anthropic. In: it-daily.net. 2. Juni 2024, abgerufen am 19. Juni 2026.
  14. OpenAI researcher who resigned over safety concerns joins Anthropic. In: The Verge. 28. Mai 2024, abgerufen am 19. Juni 2026 (englisch).
  15. Alignment Science Blog. Anthropic, abgerufen am 19. Juni 2026 (englisch).
  16. Jan Leike, David Krueger, Tom Everitt, Miljan Martic, Vishal Maini, Shane Legg: Scalable agent alignment via reward modeling: a research direction. In: arxiv.org. 19. November 2018, abgerufen am 19. Juni 2026 (englisch).
  17. Harry Booth: TIME100 AI 2024: Jan Leike. In: Time. 5. September 2024, abgerufen am 19. Juni 2026 (englisch).

Content Disclaimer

Informasi ini disarikan dari Wikipedia dan disajikan kembali untuk tujuan edukasi. Konten tersedia di bawah lisensi CC BY-SA 3.0. Kami tidak bertanggung jawab atas ketidakakuratan data yang bersumber dari kontribusi publik tersebut.

  1. The information displayed on this website is sourced in part or in whole from Wikipedia and has been adapted for the purpose of restating it. We strive to provide accurate and relevant information, however:
  2. There is no guarantee of absolute accuracy. Wikipedia is an open, collaborative project that can be edited by anyone, so information is subject to change.
  3. It is not intended to constitute professional advice. The content displayed is for informational and educational purposes only. For important decisions (e.g., medical, legal, or financial), please consult a professional.
  4. Content copyright. Wikipedia is licensed under the Creative Commons Attribution-ShareAlike License (CC BY-SA). This means that content may be reused with appropriate attribution and shared under a similar license.
  5. Responsible use. Any risk arising from the use of information from this website is entirely the responsibility of the user.