Mostrando entradas con la etiqueta bases de datos. Mostrar todas las entradas
Mostrando entradas con la etiqueta bases de datos. Mostrar todas las entradas

Uso de bases de datos (ej 3)

En esta actividad se llevó a cabo la búsqueda del término pp1 holoenzyme en distintas bases de datos con el objetivo de comparar y analizar los resultados de búsqueda obtenidos en cada una de ellas. Además, se va a llevar a cabo una comparación de los formatos PDB, UniProt, GenPept y FASTA. 

Protein Data Bank (PDB)

El PDB es un repositorio de información de las estructuras tridimensionales tanto de proteínas como de ácidos nucleicos.[1] El PDB permite tanto la búsqueda de estos datos como el análisis y la visualización de los resultados.[1]

Al realizar la búsqueda en el PDB del término pp1 holoenzyme, solamente se muestran tres resultados. Todos estos resultados se refieren a la subunidad catalítica PP1-alfa unida a dos subunidades reguladoras distintas:


  • Uno de los resultados es el PDB asignado, que se corresponde a la holoenzima formada al unirse al inhibidor NIPP1. 
  • Los otros dos resultados se corresponden a las dos formas del cristal utilizado para el análisis de la estructura tridimensional por difracción de rayos X de la subunidad catalítica unida a la subunidad reguladora 10 de PP1 (de Rattus norvegicus).
Sin embargo, la secuencia primaria correspondiente a la subunidad catalítica alfa de estos 3 PDB es la misma. 


Al hacer una búsqueda por similaridad en la secuencia de aminoácidos con un cutoff del 95% se han obtenido un total de 27 cadenas que se corresponden a distintos PDB de las subunidades catalíticas alfa y gamma de PP1 de humano y de Mus musculus. 

La secuencia primaria del PDB se puede extraer cómo se ha realizado en las actividades anteriores por análisis de todos los átomos del PDB. Sin embargo, el propio PDB recoge la secuencia primaria de la proteina en el campo SEQRES. En este campo se recoge la secuencia de aminoácidos en líneas formadas por trece aminoácidos en código de tres letras. Además, en cada línea se indica su número, la cadena polipeptídica a la que pertenece y el número total de aminoácidos de esa cadena.

Un ejemplo de la primera línea del PDB asignado es:


SEQRES   1 A  306  GLY HIS MET GLY SER LEU ASN LEU ASP SER ILE ILE GLY          

Universal Protein Resource (UniProt)

UniProt es un recurso muy extenso para secuencias de proteínas.[2] Dentro de las bases de datos de UniProt cabe destacar UniProt Knowledgebase (UniProtKB), que recoge una gran cantidad de datos sobre información funcional de proteínas[3] y permite llevar a cabo búsquedas de una gran cantidad de información, desde secuencias de aminoácidos hasta datos taxonómicos de una proteína.

La búsqueda de pp1 holoenzyme en UniProtKB dio lugar a un total de 27 resultados de proteínas que se encuentran en distintos organismos y ninguno de ellos se corresponde con la holoenzima de pp1. Algunos de los resultados se refieren a la subunidad reguladora 14B y a la subunidad catalítica 2A de pp1 encontradas en distintos organismos (Mus musculus, Homo sapiens, Rattus norvegicus). Mientras que otros resultados son proteínas tan dispares como el factor de unión 3 de la interleuquina o la serina/treonina proteína quinasa del protooncogen RAF. 

Al realizar la búsqueda de pp1 se obtiene un total de 3.859 resultados. La mayoría de los resultados mostrados en las primeras páginas se refieren a distintas subunidades reguladoras y catalíticas de PP1 encontradas en distintos organismos.

No se ha encontrado el archivo de UniProt característico de la holoenzima asignada, pero sí se ha encontrado el archivo que se refiere a la subunidad catalítica alfa de PP1. La secuencia de aminoácidos de ambos archivos difiere al principio de la secuencia, ya que el archivo PDB no tiene los seis primeros residuos, y al final de la secuencia, ya que el archivo PDB tampoco contiene los aminoácidos finales. Así, el número de aminoácidos del archivo de UniProt contiene un total de 330 aminoácidos, mientras que el archivo PDB tiene un total de 306 aminoácidos.

En el formato de esta base de datos, la secuencia de aminoácidos se encuentra al final del archivo tras una línea de la que caben destacar las siguientes columnas:
  • Dos cadenas de caracteres 'SQ' y 'SEQUENCE' que especifican que a continuación se muestra la secuencia de aminoácidos.
  • El número de aminoácidos.
  • El peso molecular de la proteína.
A continuación se muestra un ejemplo de este tipo de línea:

SQ   SEQUENCE   330 AA;  37512 MW;  60C37E1AD9831DAC CRC64

A partir de la línea recién descrita se encuentra la secuencia de aminoácidos en grupos de 10 aminoácidos separados por un espacio, como se puede observar en el siguiente ejemplo:

MSDSEKLNLD SIIGRLLEVQ GSRPGKNVQL TENEIRGLCL KSREIFLSQP ILLELEAPLK

National Center for Biotechnology Information (NCBI)

El NCBI almacena y actualiza constantemente una gran cantidad de información referente a secuencias genómicas, artículos científicos u otros datos biotecnológicos de interés. En concreto, para el estudio de proteínas presenta la base de datos Protein formada por una gran colección de secuencias de proteínas procedentes de traducciones de regiones codificantes de otras bases de datos como GenBank y de registros procedentes de bases de datos como SwissProt. 

Al realizar la búsqueda de pp1 holoenzyme en la base de datos Protein se obtuvieron un total de 86 resultados entre los que se incluyen como resultados únicos las distintas cadenas polipeptídicas que se ven englobadas en un mismo PDB.

Aunque se pueden descargar las secuencias en otros formatos, el que emplea esta base de datos es el formato GenPept, donde la secuencia de aminoácidos se encuentra al final del archivo tras una línea denominada 'ORIGIN'. 

La estructura de las líneas que definen la secuencia de aminoácidos es la siguiente:
  • El número del primer aminoácido de la línea.
  • La secuencia de aminoácidos en grupos de 10 aminoácidos en formato de una letra separados por un espacio.
Un ejemplo de esta estructura:

        1 ghmgslnlds iigrllevqg srpgknvqlt eneirglclk sreiflsqpi lleleaplki

Formato FASTA

Todas las bases de datos comentadas anteriormente permiten descargar la secuencia de aminoácidos de la proteína en este formato. 

En este formato se observan dos partes bien diferenciadas:
  • La primera línea, donde se indica el número de acceso, el nombre en el PDB y el título del archivo.
  • En el resto del archivo se muestra la secuencia de aminoácidos de la proteína en código de una letra y sin espacios.
Un ejemplo de esta estructura:

GHMGSLNLDSIIGRLLEVQGSRPGKNVQLTENEIRGLCLKSREIFLSQPILLELEAP

Bibliografía


Función CargarPDB (ej 5)

La función CargarPDB se encuentra en el interior de la librería BioTools y es capaz de leer, extraer y guardar en una estructura matricial denominada TPDB los principales campos de un fichero PDB cargado en un memo. Esta función es esencial para llevar a cabo la mayor parte de las actividades del Cuaderno de Actividades.

La función se ha diseñado de tal manera que es capaz de recorrer los campos de un memo y, mediante el reconocimiento de cadenas de caracteres y teniendo en cuenta a qué posiciones de la línea corresponde cada uno de los datos en un PDB, permite extraer la información deseada.

En concreto, esta función lleva a cabo la creación de dos estructuras matriciales en las que se guarda la información más relevante, denominadas como tipo TPDB y tipo TAtomPDB, cuyos campos se indican a continuación:

TPDB

Incluye los campos más relevantes de la proteína:

  • Header. Es el cabecero de la proteína. En él se ha incluido el campo Title del PDB que, como su nombre indica, es el título del archivo PDB.
  • Atm. Se corresponde a todos los átomos de la proteína, con todos los campos correspondientes característicos del archivo PDB. En concreto, el tipo de variable de este campo es TAtomPDB, que se comentará a continuación. 
  • TotalAtm. Recoge el número total de átomos del PDB. 
  • ResIndex. Recoge los números de ficha correspondientes a los carbonos alfa.
  • TotalResiduos. Indica el número total de residuos de la proteína. 

TAtomPDB

Incluye todos los campos que describen a un átomo en un fichero PDB:

  • NumAtomo. Es el número del átomo.
  • ID. Indica qué tipo de átomo es dentro de la nomenclatura característica de los átomos que constituyen un aminoácido.
  • AA. Recoge el nombre del aminoácido del que forma parte.
  • Sub. Indica a qué subunidad de la proteína pertenece el átomo/aminoácido.
  • Residuo. Recoge el número del residuo/aminoácido al que pertenece.
  • Coor. Son las coordenadas tridimensionales del átomo. Este campo es una variable del tipo TPunto, formado por los campos 'X', 'Y', 'Z', correspondientes al valor de la coordenada X, Y, Z, respectivamente. 
  • Temperature. Recoge el factor de temperatura asociado a ese átomo.

Identificación del formato de la proteína (ej 4)

El programa entregado al profesor como "Ejercicio4" es capaz de identificar entre los formatos EMBL, UniProt, GenPept, FASTA y PDB. 

El diagrama de flujo del funcionamiento de este programa se representa y explica a continuación:




  • El fichero de la proteína en cualquiera de los formatos anteriores se carga en el programa y se introduce en un memo.
  • Se utiliza un bucle para recorrer todas las líneas de este memo.
  • Mientras se recorren las líneas, se utiliza un algoritmo de comparación que busca cadenas de caracteres determinadas que se encuentran o en la primera línea del archivo o en la segunda línea. En concreto, las cadenas de caracteres utilizadas son:
    • Formato FASTA. El carácter '>' en la primera posición de la primera línea del memo.
    • Formato GENPEPT.  La cadena de caracteres 'LOCUS' en la primera posición de la primera línea del memo.
    • Formato PDB. La cadena de caracteres 'HEADER' en la primera posición de la primera línea del memo.
    • Formato EMBL. La cadena de caracteres 'ID' en la primera posición de la primera línea del memo. Como esta característica es compartida con el formato UNIPROT, se busca también la cadena de caracteres 'XX' en la primera posición de la segunda línea del memo.
    • Formato UNIPROT. La cadena de caracteres 'ID' en la primera posición de la primera línea del memo y la cadena de caracteres 'AC' en la primera posición de la segunda línea del memo. 

Una vez se ha determinado qué formato se ha cargado, el programa lleva a cabo la carga como un tipo TStringList de los aminoácidos que forman parte de la secuencia de la proteína y, en el caso de que sea necesario, convierte el código de tres letras en una única letra. En concreto, el programa es capaz de extraer la secuencia de aminoácidos de los formatos FASTA, PDB, UNIPROT y GENPEPT y representarlos en un segundo memo. No se ha desarrollado un algoritmo para extraer la secuencia de aminoácidos del formato EMBL porque ésta está en desuso. A continuación se explican las funciones desarrolladas para llevar esto a cabo, todas incluidas en la librería Biotools:

  • En el caso del formato FASTA, se emplea la función CargarFASTA que introduce todas las líneas del memo que no empiecen por el caracter '>', ya que éstas son las correspondientes a los aminoácidos.
  • Para el formato PDB, se emplea la función CargarAAPDB. El archivo se carga primero como un TPDB, gracias a la función CargarPDB (explicada en el ejercicio 5). A continuación, se realiza un recorrido de todos los residuos del TPDB y se extrae el nombre del aminoácido, en codigo de tres letras. Por último, se transforma al código de una letra. Para hacerlo más visual, en el memo se muestran 10 aminoácidos por línea. 
  • En el caso del formato UNIPROT se emplea la función CargarUNIPROT.  Lleva a cabo un recorrido de todo el memo hasta encontrar la línea que contiene la línea de caracteres 'SQ' y comienza a tomar las líneas que hay a continuación de esta línea, ya que son las correspondientes a los aminoácidos.
  • Para el formato GENPEPT se emplea la función CargarGENPEPT. Recorre el memo hasta encontrar la línea que contiene la línea de caracteres 'ORIGIN' y comienza a tomar las líneas que hay a continuación de esta línea ya que se corresponden a la secuencia de aminoácidos, excepto la última del memo. Además, se ha tenido en cuenta que estas lineas comienzan con números y espacios para no introducirlos.
Se ha comprobado que el programa funciona con todos los formatos. En la carpeta se adjunta la proteína adjudicada en los formatos GENPEPT, PDB y FASTA. No se ha encontrado en formato UNIPROT, de forma que se ha utilizado otra proteína en ese formato para realizar la comprobación, resultando la identificación también exitosa.

La secuencia de aminoácidos de la proteína encontrada en los tres formatos es la misma:

'GHMGSLNLDSIIGRLLEVQGSRPGKNVQLTENEIRGLCLKSREIFLSQPILLELEAPLKICGDIHGQYYDLLRLFEYGGFPPESNYLFLGDYVDRGKQSLETICLLLAYKIKYPENFFLLRGNHECASINRIYGFYDECKRRYNIKLWKTFTDCFNCLPIAAIVDEKIFCCHGGLSPDLQSMEQIRRIMRPTDVPDQGLLCDLLWSDPDKDVQGWGENDRGVSFTFGAEVVAKFLHKHDLDLICRAHQVVEDGYEFFAKRQLVTLFSAPNYCGEFDNAGAMMSVDETLMCSFQILKPADKNKGKYG'