Aller au contenu principal
Intelligence artificielleUSUS

Google DeepMind étend SynthID Bio aux protéines conçues par IA

Google DeepMind a présenté SynthID Bio, un outil qui inscrit une signature dans la séquence d'acides aminés ou la structure 3D prédite d'une protéine, selon The Next Web. Les tests en laboratoire montrent que la marque n'altère pas le fonctionnement des protéines.

4 min de lectureMis à jour il y a 2 h
Illustration de l’article
Crédit image : Google DeepMind
Dans cet article
  1. Un marquage invisible dans la séquence et la structure
  2. Un outil pour alléger le criblage des commandes
  3. Evo 2 et un bactériophage marqué

Un marquage invisible dans la séquence et la structure

Google DeepMind transpose sa technologie de filigrane SynthID à la biologie de synthèse. Le nouvel outil, baptisé SynthID Bio, dissimule une signature dans la séquence d'acides aminés ou dans la structure 3D prédite d'une protéine, selon The Next Web. Le laboratoire a présenté ses travaux dans un billet de blog et un article publié dans Nature.

D'après Google DeepMind, un test permet de retrouver la signature aussi bien dans la protéine physique que dans le design numérique. Lors des essais en laboratoire, le marquage n'a pas modifié le comportement des protéines.

« SynthID Bio est une pièce importante du puzzle pour tracer la provenance des designs biologiques », a déclaré Sarah Carter, experte en politique de biosécurité chez Science Policy Consulting, qui a relu les travaux.

Comment fonctionne le filigrane

Pour les séquences, SynthID Bio oriente le choix des acides aminés. Pour les structures 3D, il ajuste les coordonnées atomiques.

L'outil s'intègre à ProteinMPNN, un logiciel de conception de protéines du Baker Lab. Il s'appuie sur une clé, comparable à une clé cryptographique, pour proposer chaque acide aminé suivant. ProteinMPNN écarte toute suggestion incompatible avec une protéine fonctionnelle. Pour détecter la marque, un logiciel parcourt l'ensemble de la séquence avec la clé et mesure la fréquence d'apparition des acides aminés suggérés.

L'équipe a testé des binders, des protéines conçues pour se fixer à d'autres protéines. Elle les a générés avec AlphaProteo et une version SynthID Bio de ProteinMPNN. Les essais ont porté sur trois cibles : VEGF-A, le domaine RBD de la protéine spike du SARS-CoV-2 et PD-L1. Les designs marqués ont affiché des performances comparables aux non marqués en taux de succès, affinité de liaison et diversité des séquences. Adaptyv Bio a participé aux tests en laboratoire.

Pour les structures, SynthID Bio ajuste finement une petite partie du réseau de diffusion d'AlphaFold 3. Le filigrane réside alors dans les poids du modèle. Google DeepMind affirme qu'AlphaFold 3 conserve sa précision et que la détection est quasi parfaite.

Un outil pour alléger le criblage des commandes

Pour fabriquer une protéine conçue, un laboratoire commande de l'ADN à une entreprise de synthèse. Ces sociétés comparent les commandes à des bases de données de menaces connues. Or l'IA peut désormais produire des séquences qui ressemblent peu à un danger répertorié, explique Google DeepMind. Les commandes inhabituelles peuvent alors exiger de longues vérifications manuelles. Un filigrane pourrait indiquer qu'une commande provient d'un modèle de confiance.

« Pour Twist, le filigrane constitue un ajout prometteur à la boîte à outils de biosécurité, susceptible de renforcer le criblage, de concentrer les ressources sur les séquences qui méritent un examen plus attentif et de rendre la biosécurité plus efficace à mesure que la biologie conçue par IA progresse », a déclaré James Diggans, vice-président chargé des politiques et de la biosécurité chez Twist Bioscience.

Google DeepMind indique que la marque pourrait aussi servir à étiqueter les entrées générées par IA dans les bases de données publiques. Le laboratoire cite la Protein Data Bank, UniProt et GenBank.

Des limites reconnues

L'équipe a signalé plusieurs limites. La sécurité du système dépend de la manière dont les clés sont partagées et stockées. Les protéines très courtes peuvent contenir trop peu d'acides aminés marqués pour être détectées. Fusionner une protéine marquée avec une autre qui ne l'est pas risque de diluer le signal. La détection étant statistique, le seuil retenu détermine le taux de faux positifs et de faux négatifs.

De nombreux outils de conception de protéines par IA n'utilisent pas ProteinMPNN. Google DeepMind reconnaît qu'il reste à rendre la marque plus difficile à retirer volontairement.

Evo 2 et un bactériophage marqué

Google DeepMind a également intégré SynthID Bio à Evo 2, un modèle génomique, avec le Hie lab de l'université Stanford et l'Arc Institute. Ensemble, ils ont marqué le génome d'un bactériophage conçu par Evo 2. Un bactériophage est un virus qui infecte les bactéries. Les premiers essais en cultures bactériennes montrent que les phages marqués fonctionnent, selon le laboratoire, qui prévoit de publier un article technique.

Google DeepMind a rendu le code et les données de laboratoire open source. Il publie aussi les poids du modèle pour les chercheurs.

Maillage