Predictor@home war ein frühes Projekt für freiwilliges Rechnen in der Biologie. Es sollte aus der Aminosäuresequenz eines Proteins seine räumliche Struktur ableiten. Die Arbeit begann 2004 am Scripps Research Institute und der University of California San Diego. Historisch ist das Projekt vor allem deshalb wichtig, weil es noch vor der BOINC-Umstellung von SETI@home als erstes eigenständiges Forschungsprojekt auf dieser Plattform öffentlich arbeitete.
Proteine bestehen aus Ketten von Aminosäuren. Wie sich eine solche Kette im Raum anordnet, beeinflusst ihre Funktion: Bindungsstellen, Beweglichkeit und Wechselwirkungen mit anderen Molekülen hängen von der dreidimensionalen Form ab. Die vollständige Struktur allein aus der Sequenz vorherzusagen ist jedoch schwierig. Schon für ein einzelnes Protein gibt es sehr viele mögliche Anordnungen, von denen die allermeisten biologisch nicht plausibel sind.
Viele mögliche Faltungen
Predictor@home verteilte deshalb nicht eine große, zusammenhängende Simulation auf das Internet. Es schickte viele voneinander getrennte Arbeitspakete an freiwillige Rechner. Jedes Paket erzeugte oder verfeinerte Kandidaten für eine Proteinstruktur. Nach der Rückgabe der Ergebnisse konnten die Forschenden die vielversprechenden Modelle vergleichen und weitere Rechenschritte auf sie konzentrieren.
Die wissenschaftliche Grundlage war ein mehrstufiges Verfahren. Zunächst wurden große Bereiche möglicher Faltungen erkundet. Danach sollten physikalisch begründete Bewertungsfunktionen und detailliertere Rechnungen helfen, realistische Strukturen von weniger plausiblen Kandidaten zu unterscheiden. Der entscheidende Vorteil des verteilten Rechnens lag nicht in einer einzelnen besonders schnellen Simulation, sondern in der Zahl der unabhängig untersuchten Varianten.
Das passt zu einem zentralen Problem der Strukturvorhersage: Eine gute Methode muss nicht nur eine Struktur berechnen können, sondern auch genug Alternativen durchsuchen, um eine naturähnliche Form nicht zu übersehen. Die Projektpublikation beschreibt, dass Predictor@home die verfügbare Stichprobe gegenüber einem lokalen Rechnercluster um ein bis zweieinhalb Größenordnungen erweiterte.
Einsatz bei CASP6
Ein wichtiges Einsatzfeld war CASP6, die sechste Runde des internationalen Vergleichs Critical Assessment of Techniques for Protein Structure Prediction. In diesem Format erhalten Arbeitsgruppen Sequenzen von Proteinen, deren experimentell bestimmte Struktur zunächst nicht öffentlich ist. Ihre Vorhersagen können anschließend mit den Referenzstrukturen verglichen werden. Das schafft eine klarere Prüfung als ein Vergleich mit bereits bekannten Lösungen.
Predictor@home nutzte die verteilte Rechenleistung für diese Aufgabe und verband sie mit einem zentralen Ablauf für Datenausgabe, Rücklauf, Kontrolle und Auswertung. Das Projekt war damit sowohl ein Test für Methoden der Strukturvorhersage als auch für die Frage, ob eine heterogene Menge privater Computer wissenschaftliche Simulationen verlässlich tragen kann.
Die Antwort war nicht einfach nur eine Frage der Rechenmenge. Unterschiedliche Prozessoren und Betriebssysteme können bei numerischen Rechnungen leicht abweichende Ergebnisse liefern. Für die molekularen Simulationen entwickelten die Beteiligten deshalb Verfahren, die Ergebnisse vergleichbarer Rechner gegeneinander absichern. Auch das wurde zu einem Thema eigener Fachveröffentlichungen.
Ein Pionier der BOINC-Ära
Als Predictor@home im Juni 2004 startete, war BOINC noch eine junge Infrastruktur. SETI@home hatte das System inspiriert, lief aber zu diesem Zeitpunkt noch nicht in seiner späteren BOINC-Version. Predictor@home zeigte früh, dass die Plattform nicht auf die Auswertung von Radiodaten beschränkt war. Ein Forschungsprojekt konnte eigene Anwendungen verteilen, Ergebnisse einsammeln und Rechenkapazität für ein klar abgegrenztes wissenschaftliches Problem aufbauen.
Das Projekt ist heute abgeschlossen. Seine Inhalte und Server sind nicht mehr Teil des laufenden BOINC-Angebots. Erhalten geblieben ist seine Rolle in der Geschichte des Volunteer Computing: als früher Nachweis, dass sich die offene Infrastruktur für rechenintensive Fragen der Biologie einsetzen ließ. Spätere Projekte wie Rosetta@home arbeiteten ebenfalls an Proteinstrukturen, mit eigenen Forschungsfragen und Verfahren.
Ziele
- Dreidimensionale Strukturen von Proteinen aus ihren Aminosäuresequenzen vorhersagen.
- Neue Verfahren der Proteinstrukturvorhersage im Rahmen von CASP6 erproben und auswerten.
Methoden
- Verteiltes Rechnen über die BOINC-Plattform.
- Monte-Carlo-Simulationen und molekulardynamisch begründete Bewertung von Proteinstrukturen.
- Viele unabhängige Berechnungen möglicher Faltungen, anschließende Auswahl und Verfeinerung vielversprechender Modelle.
Ergebnisse
- Predictor@home war das erste eigenständige Forschungsprojekt, das BOINC außerhalb von Berkeley einsetzte.
- Bei CASP6 erweiterte das Projekt die Zahl der untersuchten Strukturvarianten gegenüber einem lokalen Cluster um ein bis zweieinhalb Größenordnungen.
- Das Projekt hinterließ mehrere Publikationen zu Proteinstrukturvorhersage und zur zuverlässigen Ausführung wissenschaftlicher Berechnungen auf freiwillig bereitgestellten Rechnern.
Quellen
- BOINC - an approach to grid (distributed)
BOINC · conference-material · tier-2 - Publications by BOINC Projects
BOINC, University of California, Berkeley · official-report · tier-2 - Predictor@Home: A Protein Structure Prediction Supercomputer Based on Global Computing
IEEE Transactions on Parallel and Distributed Systems · peer-reviewed-paper · tier-1