Un informe sobre usos de IA, no una prueba de más descubrimientos
AI in Science: Early Insights examina cómo se está utilizando la inteligencia artificial en el trabajo científico. La página de MIT FutureTech fecha el informe el 16 de septiembre de 2026 y lo atribuye a una colaboración con Google y Google DeepMind. El estudio combina tres tipos de evidencia: una muestra de 15 millones de interacciones con Gemini, un inventario de más de 2.600 modelos especializados y una encuesta a más de 600 científicos de Estados Unidos y Reino Unido.
Esa combinación permite observar el fenómeno desde ángulos distintos, pero no convierte el informe en un experimento que demuestre que la IA causa un aumento de la producción científica. Las interacciones registran actividad en un producto; el inventario describe herramientas disponibles; y la encuesta recoge respuestas de personas. Ninguna de esas medidas, por sí sola, establece que se publiquen más resultados, que estos sean mejores o que ocurran más descubrimientos gracias a la IA.
La distinción es importante porque una tarea más rápida no equivale necesariamente a un proyecto científico más corto. El tiempo que se libera puede dedicarse a revisar resultados, ejecutar experimentos, explorar otras hipótesis o atender tareas que antes se aplazaban. Para saber qué sucede en cada caso hacen falta medidas de resultados y comparaciones adecuadas, además de datos sobre el uso de las herramientas.
Tres fuentes que responden a preguntas diferentes
El primer componente es la muestra de interacciones con Gemini. Puede ayudar a describir qué tipos de tareas aparecen en el uso de ese sistema, pero no representa automáticamente toda la actividad científica ni todo el uso de IA. Las conversaciones con un producto no incluyen necesariamente el trabajo realizado con otras herramientas, sistemas privados o procesos que no pasan por una interfaz conversacional. La cifra de 15 millones indica el tamaño de la muestra descrita, no el número de científicos que participaron.
El segundo componente es un inventario de más de 2.600 modelos especializados. Su presencia permite situar el análisis más allá de los modelos de propósito general: hay sistemas diseñados para tareas o dominios concretos. Pero contar modelos no equivale a medir cuántos laboratorios los usan, con qué frecuencia se emplean ni qué resultados producen. Para esas conclusiones harían falta datos de adopción y evaluación que no deben inferirse únicamente del tamaño del inventario.
La tercera fuente es una encuesta a más de 600 científicos de Estados Unidos y Reino Unido. Esta aporta información sobre experiencias y estimaciones declaradas por los participantes. Su interpretación depende de cómo se reclutó a las personas, de quién respondió y de cómo se formularon las preguntas. La información disponible en las fuentes proporcionadas no permite establecer aquí la representatividad de la muestra, la tasa de respuesta ni si se aplicaron ponderaciones. Por ello, sus respuestas no deben presentarse como una medición de toda la comunidad científica.
Qué puede aportar cada fuente y qué no establece por sí sola
| Fuente | Qué ayuda a observar | Límite de interpretación |
|---|---|---|
| Interacciones con Gemini | Actividad y tipos de interacción registrados en esa muestra | No equivale a todo el uso de IA ni identifica por sí sola resultados científicos |
| Inventario de modelos especializados | Disponibilidad de herramientas para tareas o dominios específicos | El número de modelos no mide adopción, eficacia ni impacto |
| Encuesta a científicos | Experiencias y estimaciones comunicadas por quienes respondieron | Depende del muestreo, la respuesta y el carácter autodeclarado de los datos |
Casi siete horas semanales: una estimación declarada
La cifra que más fácilmente puede descontextualizarse es la de casi siete horas semanales que los encuestados dicen ahorrar. Según el informe, se trata de una estimación comunicada por los participantes. No debe describirse como si un cronómetro hubiera registrado cuánto tardaban antes y después de incorporar IA, ni como una medida independiente de productividad.
El autoinforme es útil para conocer cómo perciben las personas el efecto de una herramienta. También puede reflejar tareas concretas que se completan con mayor rapidez. Sin embargo, depende de la memoria, de la interpretación individual de qué significa «ahorrar tiempo» y de la comparación que cada persona haga con una situación hipotética sin IA. Sin una línea base observada, no se puede saber con la misma precisión si el ahorro declarado coincide con el tiempo efectivamente liberado.
Tampoco se deduce de esa cifra que cada científico ahorre lo mismo, que el ahorro se mantenga en cualquier disciplina o que las horas se conviertan íntegramente en investigación adicional. Algunas pueden destinarse a corregir respuestas, repetir análisis o comprobar información. Otras pueden reducir tareas administrativas o facilitar una primera exploración, pero no necesariamente acortar el ciclo completo de una investigación.
Por tanto, la formulación más fiel es que los encuestados estiman un ahorro cercano a siete horas por semana. Transformar esa percepción en una afirmación sobre productividad requiere más evidencia: mediciones longitudinales, definiciones comparables de las tareas y resultados observables, además de un grupo o una línea base que permitan entender qué habría ocurrido sin la herramienta.
Modelos generales y especializados no son medidas intercambiables
El estudio reúne información sobre Gemini y un inventario de modelos especializados, dos categorías que conviene mantener diferenciadas. Un modelo de lenguaje de propósito general puede servir para tareas variadas, como redactar o resumir texto. Un modelo especializado está concebido para una tarea o ámbito más acotado. Que ambos aparezcan en el panorama de la IA científica no significa que tengan el mismo uso, que se sustituyan entre sí ni que su rendimiento pueda compararse con un único indicador.
La taxonomía de tareas científicas asociada al trabajo de MIT FutureTech ofrece contexto para ordenar qué actividades se consideran trabajo científico. Ese marco puede ayudar a clasificar tareas, pero una clasificación no demuestra que la IA las complete correctamente ni que reduzca el tiempo total de una investigación. Para valorar una herramienta concreta importan la tarea, el dominio, los criterios de evaluación y la intervención humana que requiere.
En la práctica, la utilidad puede variar incluso dentro de un mismo proyecto. Una herramienta puede apoyar una etapa de búsqueda o análisis y, al mismo tiempo, necesitar comprobaciones sustanciales antes de que sus resultados se incorporen a una decisión experimental. Por eso, no basta con preguntar si un modelo es «útil para la ciencia»: hay que precisar para qué tarea, bajo qué controles y con qué evidencia de desempeño.
Preguntas útiles al comparar herramientas científicas
| Pregunta | Por qué importa |
|---|---|
| ¿Qué tarea concreta realiza? | Evita comparar herramientas con funciones y objetivos distintos |
| ¿Cómo se verifica la respuesta? | Permite considerar el trabajo de revisión y validación, no solo la primera salida |
| ¿Qué resultado se evalúa? | Distingue rapidez, exactitud, reproducibilidad y utilidad para el proyecto |
| ¿Quién puede generalizar el resultado? | Aclara si la evidencia aplica a una herramienta, una disciplina o una población más amplia |
La validación y la experimentación siguen formando parte del trabajo
El informe señala que validar resultados y probar hipótesis continúan consumiendo tiempo. Esta observación limita una lectura simplista según la cual automatizar una parte del proceso elimina los obstáculos de la investigación. Una sugerencia generada por IA puede requerir comprobaciones; una hipótesis plausible no es un resultado confirmado; y un análisis digital no sustituye automáticamente la observación o la experimentación necesarias para responder una pregunta.
La diferencia entre el trabajo digital y el físico es especialmente relevante. La cobertura de Scientific American sobre el estudio pone el foco en que la IA puede acelerar ciertas tareas de investigación sin acelerar al mismo ritmo los experimentos de laboratorio. Es un contexto útil para pensar en los cuellos de botella, aunque una pieza de prensa secundaria no sustituye los datos ni el método del informe original.
La validación clínica también plantea exigencias propias: una idea o un resultado inicial no demuestra que una intervención sea segura o eficaz en personas. En términos generales, el paso de una propuesta a una conclusión fiable depende de procedimientos de comprobación adecuados al campo. Las fuentes disponibles permiten señalar que validar y experimentar siguen siendo trabajo pendiente, pero no autorizan a cuantificar aquí cuánto tiempo consume cada etapa ni a atribuir un mismo cuello de botella a todas las disciplinas.
Una secuencia para no confundir propuesta con evidencia
- 01Precisar qué tarea o hipótesis se quiere abordar con la herramienta.
- 02Examinar la salida y comprobarla con métodos y fuentes apropiados al área.
- 03Cuando corresponda, contrastar la hipótesis mediante experimentación o evaluación clínica.
- 04Informar por separado del tiempo empleado, las comprobaciones realizadas y el resultado obtenido.
Límites: selección, alcance geográfico y causalidad
La encuesta se refiere a científicos de Estados Unidos y Reino Unido; por ello, no debe tratarse automáticamente como representativa de investigadores de otros países, instituciones o disciplinas. Las diferencias en recursos, acceso a herramientas, normas profesionales e infraestructura pueden afectar tanto al uso como a la experiencia. Las fuentes proporcionadas no detallan aquí suficiente información para valorar la representatividad o trasladar las respuestas a toda la comunidad científica.
También hay que considerar quién acepta participar en una encuesta sobre IA. Scientific American advierte, al contextualizar el estudio, que el reclutamiento mediante paneles puede favorecer la participación de usuarios frecuentes de estas herramientas. Esa posibilidad es una cautela sobre selección, no una demostración de que la encuesta esté sesgada en una dirección determinada. Para medir su alcance habría que conocer el método de reclutamiento, la tasa de respuesta y las características de participantes y no participantes.
Por último, el informe reúne distintos tipos de evidencia, pero la asociación entre usar IA y declarar ahorro no prueba causalidad. Para sostener una conclusión causal se necesitarían diseños capaces de separar el efecto de la herramienta de otros factores, como experiencia previa, tipo de tarea, disponibilidad de personal o recursos computacionales. Además, los resultados tendrían que evaluarse de manera que incluyeran calidad y fiabilidad, no solo rapidez o percepción de ahorro.
Qué datos harían más sólida la conclusión
Una evaluación posterior podría registrar tareas comparables a lo largo del tiempo y separar el trabajo inicial del necesario para revisar y validar. También podría informar con precisión quiénes participaron, cómo fueron seleccionados, qué preguntas respondieron y cómo se trataron las respuestas. La transparencia sobre esos aspectos ayudaría a evaluar a qué población se pueden aplicar los resultados.
Para saber si el ahorro percibido se traduce en más investigación harían falta indicadores de resultados, interpretados con cautela: por ejemplo, la duración de etapas definidas, la calidad de los análisis, la reproducibilidad o la proporción de resultados que supera una validación pertinente. Ningún indicador aislado resume el valor de una investigación; la rapidez no debe desplazar la fiabilidad como criterio.
La conclusión que permiten sostener estas fuentes es más acotada, pero relevante: existe evidencia de uso de herramientas de IA y de científicos que perciben un ahorro de tiempo, mientras que la validación y la experimentación siguen siendo partes sustantivas del proceso. La magnitud exacta del efecto, su distribución entre disciplinas y su impacto en la producción científica requieren mediciones adicionales. Presentar la cifra de casi siete horas como una estimación de los encuestados, y no como productividad demostrada, conserva esa diferencia esencial.
Qué sigue abierto
- Las fuentes aportadas no permiten establecer aquí la representatividad de la encuesta, su tasa de respuesta ni si se aplicaron ponderaciones.
- No se especifican en la información disponible los periodos, los criterios de selección ni la distribución de las 15 millones de interacciones con Gemini.
- No se puede determinar con la información proporcionada cuánto del ahorro declarado corresponde a tiempo efectivamente liberado tras incluir revisión y validación.
- El informe no permite inferir por sí solo que el uso de IA cause más publicaciones, mejores resultados o descubrimientos.
- La cobertura secundaria plantea una posible sobrerrepresentación de usuarios frecuentes de IA en el panel; su alcance no puede cuantificarse con los datos aquí disponibles.
Continúa explorando
Fuentes consultadas
Correcciones y transparencia
Si detectas un dato incorrecto o desactualizado, puedes enviarnos una corrección indicando la página y la fuente que debemos revisar.
Proponer una corrección