AI-based acceleration and automation of mass spectrometry-driven drug discovery
Adàlia Agustí, Ramon
Sanjuan Gómez, Gemma dir.
Margalef, Tomàs dir.
Zamora Rico, Ismael dir.

Fecha: 2026
Resumen: Portar un nou fàrmac al mercat és un dels processos més llargs i costosos de la ciència aplicada, sovint requerint més d'una dècada i milers de milions de dòlars. Bona part d'aquest esforç es concentra en les etapes preclíniques, on les molècules candidates s'han de dissenyar, sintetitzar, provar i analitzar repetidament per entendre com es comporten en sistemes vius. Aquest cicle iteratiu, conegut com a Design-Make-Test-Analyze (DMTA), és al nucli del descobriment modern de fàrmacs. Un coll d'ampolla important d'aquest procés es troba entre les proves experimentals i l'anàlisi de dades. La tècnica principal en aquesta etapa és l'espectrometria de masses, que fragmenta les molècules, en separa els fragments segons la massa i n'enregistra els patrons resultants. Aquests patrons proporcionen informació essencial per quantificar compostos, identificar metabòlits i caracteritzar vies de degradació. Tanmateix, configurar, executar i interpretar aquests experiments requereix temps i expertesa especialitzada. En alguns fluxos de treball, els nous compostos exigeixen una optimització manual de senyals; en d'altres, les anàlisis automàtiques produeixen grans quantitats de candidats que s'han de revisar manualment per distingir els resultats reals del soroll. Aquesta tesi desenvolupa mètodes d'aprenentatge automàtic per automatitzar i accelerar diverses de les tasques més costoses d'aquest cicle. Una observació clau és que totes comparteixen una mateixa estructura: cal reduir un gran conjunt de candidats a un subconjunt petit i rellevant sota fortes restriccions de temps i atenció experta. Tant si els candidats són fragments a monitorar, pics de metabòlits o àtoms candidats a redisseny, el més important és la qualitat del subconjunt seleccionat. Per això, plantegem aquestes tasques com a problemes de learning-to-rank i ens centrem en la Precisió en k (P@k). Per optimitzar aquesta mètrica, introduïm LambdaGap, una família d'algoritmes de rànquing que resol una limitació dels mètodes existents: quan l'entrenament se centra en la part superior de la llista, el senyal del gradient esdevé escàs i l'aprenentatge s'alenteix. LambdaGap restaura densitat de senyal incorporant comparacions per parelles més enllà de la finestra top-k, mantenint el focus en la precisió de les primeres posicions. Variants híbrides com LambdaGap-S+ superen de manera consistent els mètodes de referència. Cada aplicació també ha requerit representacions moleculars específiques. Per a la predicció de transicions MRM, introduïm les Context-Aware Fingerprints per a molècules petites i una representació basada en seqüència per a pèptids. Per al triatge de metabòlits, combinem evidència cromatogràfica, espectral i cinètica en una representació unificada dels candidats. Per a la predicció del lloc de metabolisme, desenvolupem representacions basades en grafs per a pèptids i un esquema d'etiquetatge conscient de la incertesa. També aportem helmkit, una llibreria de codi obert que converteix la notació HELM en estructures atòmiques més de 700 vegades més ràpidament que les eines existents. Els mètodes desenvolupats es validen en tres aplicacions relacionades amb molècules petites i pèptids. En la predicció de transicions MRM, el model identifica almenys una transició correcta dins les cinc primeres per al 84,1% de les molècules petites. En el triatge de metabòlits, LambdaGap-S+ assoleix una P@3 de 0,856. Per a la predicció del lloc de metabolisme, els models entrenats amb etiquetes suaus arriben a un 75% de precisió top-2. Tots els mètodes presentats en aquesta tesi s'han desplegat en una plataforma comercial utilitzada per 19 de les 20 principals empreses farmacèutiques mundials. En conjunt, aquests resultats demostren que els mètodes de rànquing centrats en la precisió top-k, combinats amb representacions molecularment informatives, poden reduir significativament el temps i l'esforç expert necessaris per a tasques analítiques rutinàries en el descobriment de fàrmacs.
Resumen: Llevar un nuevo fármaco al mercado es uno de los procesos más largos y costosos de la ciencia aplicada, requiriendo a menudo más de una década y miles de millones de dólares. Gran parte de este esfuerzo se concentra en las etapas preclínicas, donde las moléculas candidatas deben diseñarse, sintetizarse, probarse y analizarse repetidamente para comprender cómo se comportan en sistemas vivos. Este ciclo iterativo, conocido como Design-Make-Test-Analyze (DMTA), constituye el núcleo del descubrimiento moderno de fármacos. Un cuello de botella importante de este proceso aparece entre las pruebas experimentales y el análisis de datos. La técnica principal en esta etapa es la espectrometría de masas, que fragmenta las moléculas, separa los fragmentos según su masa y registra los patrones resultantes. Estos patrones proporcionan información esencial para cuantificar compuestos, identificar metabolitos y caracterizar vías de degradación. Sin embargo, configurar, ejecutar e interpretar estos experimentos requiere tiempo y experiencia especializada. En algunos flujos de trabajo, los nuevos compuestos exigen una optimización manual de señales; en otros, los análisis automáticos producen grandes cantidades de candidatos que deben revisarse manualmente para distinguir resultados reales del ruido. Esta tesis desarrolla métodos de aprendizaje automático para automatizar y acelerar varias de las tareas más costosas de este ciclo. Una observación clave es que todas comparten una misma estructura: reducir un gran conjunto de candidatos a un subconjunto pequeño y relevante bajo fuertes restricciones de tiempo y atención experta. Ya se trate de fragmentos a monitorizar, picos de metabolitos o átomos candidatos a rediseño, lo más importante es la calidad del subconjunto seleccionado. Por ello, planteamos estas tareas como problemas de learning-to-rank y nos centramos en la Precisión en k (P@k). Para optimizar esta métrica, introducimos LambdaGap, una familia de algoritmos de ranking que resuelve una limitación de los métodos existentes: cuando el entrenamiento se concentra en la parte superior de la lista, la señal de gradiente se vuelve escasa y el aprendizaje se ralentiza. LambdaGap restaura densidad de señal incorporando comparaciones por pares más allá de la ventana top-k, manteniendo el foco en la precisión de las primeras posiciones. Variantes híbridas como LambdaGap-S+ superan de forma consistente a los métodos de referencia. Cada aplicación también ha requerido representaciones moleculares específicas. Para la predicción de transiciones MRM, introducimos las Context-Aware Fingerprints para moléculas pequeñas y una representación basada en secuencia para péptidos. Para el triaje de metabolitos, combinamos evidencia cromatográfica, espectral y cinética en una representación unificada de los candidatos. Para la predicción del sitio de metabolismo, desarrollamos representaciones basadas en grafos para péptidos y un esquema de etiquetado consciente de la incertidumbre. También aportamos helmkit, una librería de código abierto que convierte la notación HELM en estructuras atómicas más de 700 veces más rápido que las herramientas existentes. Los métodos desarrollados se validan en tres aplicaciones relacionadas con moléculas pequeñas y péptidos. En la predicción de transiciones MRM, el modelo identifica al menos una transición correcta entre las cinco primeras para el 84,1% de las moléculas pequeñas. En el triaje de metabolitos, LambdaGap-S+ alcanza una P@3 de 0,856. Para la predicción del sitio de metabolismo, los modelos entrenados con etiquetas suaves alcanzan un 75% de precisión top-2. Todos los métodos presentados en esta tesis se han desplegado en una plataforma comercial utilizada por 19 de las 20 principales empresas farmacéuticas del mundo. En conjunto, estos resultados demuestran que los métodos de ranking centrados en la precisión top-k, combinados con representaciones molecularmente informativas, pueden reducir significativamente el tiempo y el esfuerzo experto necesarios para tareas analíticas rutinarias en el descubrimiento de fármacos.
Resumen: Bringing a new drug to market is one of the longest and most expensive processes in applied science, often taking more than a decade and costing billions of dollars. Much of this effort is concentrated in the preclinical stages, where candidate molecules are repeatedly designed, synthesized, tested, and analyzed to understand how they behave in living systems. This iterative Design-Make-Test-Analyze (DMTA) cycle lies at the core of modern drug discovery, refining compounds toward the right balance of potency, selectivity, and safety. A major bottleneck in this cycle lies between testing and analysis, where experimental measurements must be converted into decisions. The main analytical technique at this stage is mass spectrometry, which fragments molecules, separates the fragments by mass, and records the resulting patterns. These patterns provide structural information about drugs and their transformation products, making mass spectrometry essential for quantifying compounds, identifying metabolites, and characterizing degradation pathways. However, setting up, running, and interpreting these experiments requires substantial time, material, instrument access, and expert effort. In some workflows, new compounds require labor-intensive optimization of fragment signals; in others, automated analyses produce large numbers of candidate signals that must be manually reviewed to distinguish true results from noise. This thesis develops machine learning methods to automate and accelerate several of the most costly tasks in this process. A central observation is that these tasks share a common structure: a large pool of candidates must be narrowed to a small, high-quality subset under strict constraints on time and expert attention. Whether the candidates are fragment signals, metabolite peaks, or atomic sites for redesign, the quality of the selected subset matters more than the global ordering of all candidates. We therefore frame these problems as learning-to-rank tasks and focus on Precision at k (P@k), the fraction of relevant items among the top-k predictions. To optimize this objective, we introduce LambdaGap, a family of ranking algorithms designed to overcome a limitation of existing methods: when optimization focuses on the top of the ranked list, gradient information becomes sparse and learning slows down. LambdaGap restores signal density by incorporating pairwise comparisons beyond the top-k region while preserving emphasis on top-ranked accuracy. Hybrid variants such as LambdaGap-S+ consistently outperform established baselines on standard ranking benchmarks. Each application also required molecular representations tailored to its domain. For multiple reaction monitoring (MRM) transition prediction, we introduce Context-Aware Fingerprints for small molecules and a sequence-aware representation for peptides. For metabolite identification triage, we combine chromatographic, spectral, kinetic, and reaction-level evidence into unified candidate features. For site-of-metabolism prediction, we develop uncertainty-aware labeling for ambiguous metabolite identifications and graph-based peptide representations supporting linear, cyclic, and chemically modified structures. To support peptide modeling, we also contribute helmkit, an open-source library that converts HELM macromolecular notation into atomic structures more than 700 times faster than existing tools. These methods are validated across three applications involving both small molecules and peptides. In MRM transition prediction, the model identifies at least one correct transition within the top 5 for 84. 1% of small molecules, with 97% of predictions yielding biologically equivalent results to the experimental standard. In metabolite identification triage, LambdaGap-S+ achieves a P@3 of 0. 856 on the principal small-molecule benchmark. For site-of-metabolism prediction, uncertainty-aware models achieve 75% top-2 accuracy on independent datasets, while graph-based peptide models outperform existing methods for protease cleavage prediction. All methods presented in this thesis have been deployed in a commercial software platform used by 19 of the top 20 global pharmaceutical companies. Together, these results demonstrate that top-k-focused ranking methods, combined with molecularly informed representations, can substantially reduce the time and expert effort required for routine analytical tasks in drug discovery.
Nota: Universitat Autònoma de Barcelona. Programa de Doctorat en Informàtica
Derechos: Aquest document està subjecte a una llicència d'ús Creative Commons. Es permet la reproducció total o parcial, la distribució, i la comunicació pública de l'obra, sempre que no sigui amb finalitats comercials, i sempre que es reconegui l'autoria de l'obra original. No es permet la creació d'obres derivades. Creative Commons
Lengua: Anglès
Documento: Tesi doctoral ; Text ; Versió publicada
Materia: Aprenentatge automàtic ; Machine learning ; Aprendizaje automático ; Aprenentatge a classificar ; Learning to rank ; Aprendizaje de clasificación ; Espectrometria de masses ; Mass spectrometry ; Espectrometría de masas ; Tecnologies

Adreça alternativa: https://hdl.handle.net/10803/698070


Disponible a partir de: 2028-07-14

El registro aparece en las colecciones:
Documentos de investigación > Tesis doctorales

 Registro creado el 2026-08-27, última modificación el 2026-09-02



   Favorit i Compartir