En la era de la explosión de datos, impulsada por tecnologías de secuenciación de alto rendimiento, la producción de información biológica se ha disparado a ritmos y escalas sin precedentes. Este crecimiento masivo ha trasladado el principal desafío de la generación de datos a su gestión y organización. En este contexto, las bases de datos biológicas se han convertido en una infraestructura fundamental a nivel mundial, actuando como pilares para la transformación del big data en conocimiento científico y el impulso de innovaciones cruciales en diversas áreas de investigación. Pero, ¿cuántas de estas valiosas herramientas existen realmente en el mundo?

La necesidad de catalogar y comprender el panorama global de las bases de datos biológicas llevó a la realización de un estudio exhaustivo. Este esfuerzo se propuso no solo determinar su número, sino también identificar las instituciones y países más involucrados en su desarrollo y evaluar su impacto en la investigación biomédica. El resultado es un catálogo curado que ofrece una perspectiva global sobre el estado y la influencia de estas bases de datos.
La Creación de un Catálogo exhaustivo
Para construir un catálogo completo de las bases de datos biológicas a nivel mundial, el estudio se basó en una minuciosa búsqueda y curación de literatura científica. Se identificaron publicaciones relevantes en PubMed y se sometieron a un riguroso proceso de validación por parte de curadores especializados. A partir de estas publicaciones, se extrajo manualmente metainformación clave para cada base de datos, incluyendo su nombre corto, nombre completo, URL, especies cubiertas, institución anfitriona y país. Toda esta información fue cuidadosamente curada y revisada por múltiples expertos para asegurar su precisión.

¿Cuántas Bases de Datos Biológicas Existen? El Conteo Global
Según el catálogo resultante de este estudio, actualizado hasta el 20 de septiembre de 2022, se identificaron un total de 5825 bases de datos biológicas distribuidas geográficamente en 72 países y regiones. Este impresionante número fue compilado a partir de la curación manual de más de 8900 publicaciones científicas.
La distribución de estas bases de datos no es uniforme a nivel mundial. Algunos países albergan una cantidad significativamente mayor que otros. Los principales países en cuanto al número de bases de datos son:
| País | Número de Bases de Datos |
|---|---|
| Estados Unidos (EE. UU.) | 1432 |
| China | 1106 |
| India | 425 |
| Reino Unido (RU) | 408 |
Estos cuatro países, en conjunto, representan aproximadamente el 58% del total de bases de datos globales catalogadas. Les siguen países como Alemania, Japón, Francia, Italia, Canadá y Corea, que también contribuyen de manera importante al ecosistema de datos biológicos.
En cuanto a las especies más representadas en estas bases de datos, no es sorprendente encontrar organismos modelo y de gran relevancia para la investigación. Las 10 especies principales son: humano, ratón, Arabidopsis thaliana, mosca de la fruta, Saccharomyces cerevisiae, arroz, Escherichia coli, rata, nematodo y pez cebra.
El estudio también identificó 1975 instituciones en todo el mundo que alojan múltiples bases de datos. Las instituciones que destacan por albergar la mayor cantidad de bases de datos son:
| Institución | Número de Bases de Datos |
|---|---|
| EBI (European Bioinformatics Institute) | 95 |
| Beijing Institute of Genomics, CAS & CNCB | 64 |
| NCBI (National Center for Biotechnology Information) | 61 |
Junto con estas, otras instituciones importantes en el top 10 incluyen el Institute of Microbial Technology, Peking University, Harbin Medical University, Huazhong University of Science and Technology, Zhejiang University, RIKEN y Sun Yat-sen University.
Tendencias en la Publicación de Bases de Datos
El análisis de las tendencias de publicación a lo largo de 20 años (de 2001 a 2021) muestra un crecimiento constante en el número de publicaciones asociadas a bases de datos. El número de publicaciones pasó de 97 en 2001 a 588 en 2021, lo que refleja el creciente interés y la inversión en la creación y mantenimiento de estos recursos.
Durante este período, Estados Unidos, China y el Reino Unido han sido consistentemente los países líderes en publicaciones de bases de datos. Sin embargo, una tendencia notable es que China comenzó a superar a otros países en el número de publicaciones a partir de 2019. Este cambio se correlaciona con un aumento en la inversión en gestión de datos científicos y el establecimiento de centros clave como el CNCB en el mismo año.
Evaluando el Impacto: Citación e Índice Z
Determinar el impacto científico de una base de datos es crucial para comprender su valor para la comunidad investigadora. El estudio utilizó dos métricas principales para evaluar este impacto: la citación y un nuevo indicador denominado índice z.
La citación de una base de datos se calculó sumando el total de citas de todas sus publicaciones asociadas. Esta métrica es un indicador tradicional de la influencia y el uso de un recurso en la literatura científica. Según la citación, las bases de datos más destacadas son DAVID (Database for Annotation, Visualization and Integrated Discovery), KEGG (Kyoto Encyclopedia of Genes and Genomes) y Pfam, lo que concuerda con su amplia popularidad y uso reconocido en la comunidad científica global.
Las instituciones y países también fueron clasificados según la suma total de citas de sus bases de datos asociadas. Las instituciones líderes en citación incluyen EBI, NCBI, NCI (National Cancer Institute), SIB (Swiss Institute of Bioinformatics) y Kyoto University. Consistentemente, los países líderes en citación son Estados Unidos, Reino Unido, Japón, Alemania y Suiza, lo que refleja su inversión a largo plazo en la gestión de datos biológicos.
Sin embargo, la métrica de citación tiene una limitación: las bases de datos más antiguas tienden a acumular más citas simplemente por tener más tiempo. Para normalizar esta diferencia de antigüedad y permitir una comparación más justa, el estudio propuso el índice z. Este índice se calcula dividiendo la citación de la base de datos por su edad (estimada desde el año de su primera publicación). En esencia, el índice z representa el número promedio de citas por año.
La aplicación del índice z reveló algunas diferencias interesantes en las clasificaciones. Si bien DAVID y KEGG siguen liderando, cBioPortal (cBio cancer genomics portal) se clasificó en el tercer lugar por índice z, a pesar de ocupar el noveno lugar por citación. Otras bases de datos como IGSR (International Genome Sample Resource), gnomAD (Genome Aggregation Database) y SILVA también emergieron en la lista de las 10 principales por índice z. Esto demuestra que el índice z reduce la influencia de la antigüedad y permite una comparación más equitativa entre bases de datos de diferentes edades, destacando recursos más jóvenes pero de rápido impacto.
En cuanto a instituciones y países por índice z, las instituciones líderes son EBI, NCBI, NCI, Broad Institute y SIB. Es notable que Broad Institute aparece en el top 10 por índice z pero no por citación, principalmente gracias a sus bases de datos jóvenes y altamente citadas (como GTEx). Los 10 países principales por índice z son consistentes con los de citación. Sin embargo, China se clasifica en el tercer lugar por índice z y en el sexto lugar por citación, lo que sugiere que varias de sus bases de datos más recientes están ganando popularidad e impacto rápidamente.
| Ranking | Base de Datos (Citación) | Base de Datos (Índice Z) |
|---|---|---|
| 1 | DAVID | DAVID |
| 2 | KEGG | KEGG |
| 3 | Pfam | cBioPortal |
| ... | ... | ... |
| 9 | cBioPortal | IGSR / gnomAD / SILVA (emergentes en top 10) |
Desafíos y Matices en la Evaluación
A pesar de la utilidad de las métricas de citación e índice z, es importante reconocer sus limitaciones. No todas las bases de datos tienen publicaciones asociadas, o algunas son tan fundamentales y ampliamente utilizadas (como GenBank o PubMed) que a menudo no se citan formalmente en la forma tradicional, a pesar de ser cruciales para la investigación. Evaluar el impacto de estas bases de datos requiere enfoques diferentes.
Además, la estimación de la edad de una base de datos desde el año de su primera publicación, aunque práctica, puede no ser siempre la representación más precisa de su longevidad o evolución. También es un desafío asignar una única institución o país anfitrión a bases de datos que son desarrolladas y mantenidas de forma colaborativa por múltiples entidades en diferentes países.
El panorama de las bases de datos biológicas también enfrenta desafíos prácticos, como los recortes de financiación, que pueden llevar a que algunos recursos se vuelvan inaccesibles con el tiempo. Otro factor a considerar es que las bases de datos en áreas de investigación menos populares o con comunidades más pequeñas pueden no alcanzar valores de índice z tan altos como las de áreas más candentes, incluso si son recursos esenciales dentro de su nicho. Por lo tanto, un índice z alto indica un amplio impacto, pero lo contrario no siempre es cierto.
Esto subraya la idea de que ninguna métrica única puede capturar completamente el perfil multifacético de una base de datos. Factores adicionales como el número de visitas de usuarios, las vistas de página y las valoraciones de la comunidad deberían considerarse en combinación para obtener una imagen más completa del impacto y la utilidad de un recurso. Iniciativas como la Global Biodata Coalition están trabajando para identificar recursos de biodatos fundamentales que son cruciales para mantener la infraestructura global.
Preguntas Frecuentes
- ¿Qué es una base de datos biológica?
- Es un repositorio organizado de información biológica, como secuencias de ADN o proteínas, estructuras, datos de expresión génica, información sobre enfermedades, etc., a menudo curada y anotada para facilitar su búsqueda y análisis.
- ¿Por qué son importantes las bases de datos biológicas?
- Son esenciales para gestionar la enorme cantidad de datos generados en biología, permitiendo a los investigadores acceder, integrar y analizar información para descubrir nuevos conocimientos, entender procesos biológicos y desarrollar aplicaciones en medicina y salud.
- ¿Cuántas bases de datos biológicas se identificaron en el estudio?
- El estudio catalogó 5825 bases de datos biológicas hasta septiembre de 2022.
- ¿Cuáles países albergan la mayoría de las bases de datos biológicas?
- Estados Unidos y China son los líderes, seguidos por India y el Reino Unido.
- ¿Cómo se mide el impacto de una base de datos biológica?
- Se puede medir a través de la citación (suma de citas de sus publicaciones) o el índice z (citas por año), aunque también se consideran otras métricas como el uso por parte de los usuarios.
- ¿Qué es el índice z?
- Es una métrica propuesta para evaluar el impacto de una base de datos normalizando la citación por su antigüedad, calculada como citas por año.
- ¿Dónde se puede encontrar el catálogo de bases de datos biológicas?
- El catálogo curado, Database Commons, está disponible públicamente en línea.
Conclusión
El estudio que catalogó 5825 bases de datos biológicas a nivel mundial ofrece una visión fascinante de un paisaje de datos vasto y en constante evolución. Revela una distribución geográfica desigual, identifica instituciones clave y destaca la creciente importancia de estos recursos, particularmente en países como China. Las métricas como la citación y el innovador índice z proporcionan herramientas valiosas para evaluar el impacto, aunque es fundamental reconocer sus limitaciones y considerar una variedad de factores para comprender completamente el valor de una base de datos. En una era definida por el big data, comprender y gestionar eficazmente este ecosistema de bases de datos es más crucial que nunca para el avance de las ciencias de la vida y la salud.
Si quieres conocer otros artículos parecidos a El Censo Global de Bases de Datos Biológicas puedes visitar la categoría Bases de datos.

Aprende mas sobre MySQL