Creación de datos falsos con Python Faker

¿Cuál es la diferencia entre datos falsos y datos sintéticos?

Tanto los datos falsos como los datos sintéticos se utilizan para describir datos artificiales, pero existen diferencias importantes. Las diferencias radican en las características, los usos y los métodos de generación de datos.

La siguiente tabla muestra algunas de estas diferencias.

datos falsos Datos sintéticos
Características Valores aleatorios pero típicamente dentro de rangos normales. Valores que tienen propiedades de distribución conjunta realistas.
Usos Por lo general, se utiliza para probar bases de datos y software. Se utiliza para aumentar conjuntos de datos reales para el entrenamiento de modelos, así como para garantizar la privacidad.
Métodos de generación A menudo extraídos de bases de datos de valores o valores generados aleatoriamente. Se pueden usar varios métodos de aprendizaje automático, incluidos modelos generativos antagónicos y codificadores automáticos variacionales.

Al probar bases de datos y software antes de lanzar un sistema, no se han generado datos reales y, sin embargo, es importante probar los sistemas con más de unos pocos valores. Las pruebas de interfaz de usuario y las pruebas de rendimiento están incompletas sin tener cantidades realistas de datos en un sistema. Aquí es donde puede ser útil poder generar grandes cantidades de datos falsos rápidamente.

Hay muchos recursos disponibles para generar datos falsos. Varios se enumeran en Towards Data Science, algunos de los cuales son servicios que generan datos para usted, mientras que otros son bibliotecas de software. Este artículo se centrará en la biblioteca Python Faker y cubrirá varias técnicas que pueden ser útiles para comenzar.

Creación de datos falsos utilizando la biblioteca faker de Python.

Comenzar a usar Python Faker es sencillo. Use su administrador de paquetes favorito para instalar la biblioteca Faker y luego simplemente use las siguientes declaraciones para importar la biblioteca y crear un nuevo objeto Faker y establecer una semilla aleatoria:

from faker import Faker
fake = Faker()
Faker.seed(42)

Ahora tiene una instancia que puede usar para generar datos falsos. Establecer la semilla le permite volver a generar los mismos datos falsos. Cambiar la semilla le dará diferentes valores generados aleatoriamente.

Proveedores estándar

Ahora que tenemos una instancia, generemos algunos datos falsos utilizando los proveedores estándar de la biblioteca de Python Faker.

from faker import Faker
fake = Faker()
Faker.seed(42)


#Addresses
print(fake.address())
print(fake.building_number())
print(fake.city())


#Emails
print(fake.ascii_company_email())
print(fake.ascii_free_email())


#People
print(fake.name())
print(fake.first_name())
print(fake.last_name())
print(fake.first_name_female())


#Social Security Numbers
print(fake.ssn())

Puede ver lo fácil que es generar valores aleatorios que encajarían en los campos típicos de una base de datos. Hay muchos proveedores estándar que se pueden usar sin ningún parámetro para generar datos falsos rápida y fácilmente.

Proveedores estándar con rangos

A veces es necesario generar valores que se ajusten a rangos realistas. Por ejemplo, quizás las fechas válidas para un campo sean solo fechas de este siglo o esta década. O tal vez las fechas válidas están solo en el pasado o en el futuro. O tal vez necesite probar automáticamente un formulario de entrada de contraseña y las contraseñas generadas aleatoriamente deben cumplir con las reglas de complejidad de contraseñas de su organización.

El siguiente código demuestra algunas de las capacidades integradas de los proveedores estándar que limitan los rangos de resultados mientras siguen generando datos aleatorios.

from faker import Faker
fake = Faker()
Faker.seed(42)


#Dates within ranges
print(fake.date_this_century(before_today = True))
print(fake.date_this_decade(after_today = True))
print(fake.date_time_between(start_date="-7d", end_date="now"))


#Passwords 
print(fake.password(length=16, special_chars=True, upper_case=True))
print(fake.password(length=8, special_chars=False, upper_case=False))

Generación de muchas filas de datos

En el código anterior hemos visto cómo generar valores únicos de varios tipos de datos utilizando Python Faker. En un escenario real, probablemente querríamos generar muchas filas de datos y dado que estamos trabajando en Python, probablemente querríamos estos datos en un Pandas DataFrame. El siguiente código se basa tanto en Pandas como en NumPy, por lo que si aún no los ha instalado en su entorno, deberá hacerlo antes de ejecutar este código.

from faker import Faker
import pandas as pd 
import numpy as np


Faker.seed(42)


def generate_persons(num = 1):
    fake = Faker()
    rows = [{
                'person_id':fake.uuid4(),
                'first_name':fake.first_name(),
                'last_name':fake.last_name(),
                'address':fake.address(),
                'dob':fake.date_of_birth(minimum_age = 18, maximum_age = 75),
                'ssn':fake.ssn()
            }
            for x in range(num)]
    return pd.DataFrame(rows)


persons = generate_persons(1000)
print(persons)

Puede modificar fácilmente este código para agregar diferentes columnas al DataFrame que se devuelve desde la función.

Generación de datos en escenarios más complejos

Si desea generar datos más realistas, probablemente ya tenga algunos datos para informar su definición de «realista». En estas situaciones, querrá utilizar datos sintéticos. Pero Python Faker se puede usar para generar datos que se ajustan a reglas simples y, aunque no se basan en datos reales, se pueden hacer para que parezcan realistas.

En el código de muestra a continuación, hemos modificado el generate_persons método de arriba para generar fechas de nacimiento que representan un conjunto de datos sesgados. Hacemos esto generando la distribución deseada de edades (principalmente jóvenes) y luego usando una función de utilidad de fecha, relativedelta, para crear fechas de nacimiento. Además, generamos aleatoriamente un booleano que marca ciertas filas como filas duplicadas y luego usamos la concatenación de Pandas para agregar estas filas duplicadas. Ambos hacen que los datos se parezcan más a algo que vería en un entorno del mundo real. Tenga en cuenta que el siguiente código usa matplotlib para mostrar la distribución de las fechas de nacimiento generadas, por lo que deberá asegurarse de que esta biblioteca esté instalada en su entorno antes de usar este código.

import pandas as pd 
import numpy as np
import matplotlib.pyplot as plt
from faker import Faker
from dateutil.relativedelta import relativedelta


fake = Faker()
Faker.seed(42)


def generate_persons(num = 1):
    ages = ((np.random.beta(3,8, size=num+1)) * 100).astype(np.int32)
    rows = [{
                "person_id":fake.uuid4(),
                "first_name":fake.first_name(),
                "last_name":fake.last_name(),
                "dob":fake.date_this_year() - relativedelta(years = ages[x]),
                "ssn":fake.ssn(),
                "DUP":fake.boolean(5)
            }
            for x in range(num)]
    return pd.DataFrame(rows)


persons = generate_persons(1000)
persons = pd.concat([persons, persons[persons["DUP"]]], ignore_index=True)
persons = persons.drop(columns=["DUP"])
print(persons)
print(plt.hist(persons['dob'], bins=20))

Aprende a programar con Udacity

Generar datos falsos con Python Faker es una gran habilidad para cualquier ingeniero de datos. En este artículo, aprendimos la diferencia entre datos falsos y sintéticos y aprendimos cómo generar una variedad de datos falsos utilizando la biblioteca Python Faker. Esta es una forma poderosa de generar grandes cantidades de datos rápidamente que se pueden usar para probar las interfaces de usuario y las bases de datos.

¿Quiere realmente llevar sus habilidades de ingeniería de datos al siguiente nivel?

Nuestro programa Programación para ciencia de datos con Python Nanodegree es su próximo paso. Te enseñaremos a trabajar en el campo de la ciencia de datos utilizando las herramientas fundamentales de programación de datos: Python, SQL, línea de comandos y git.

El enfoque de la terapia génica para impulsar la ‘proteína de choque frío’ en el cerebro sin enfriamiento protege a los ratones contra las enfermedades neurodegenerativas

El descubrimiento es un paso hacia el aprovechamiento de los efectos protectores del enfriamiento del cerebro para tratar a pacientes con lesión cerebral aguda e incluso para prevenir demencias, como el Alzheimer.

Cuando el cuerpo se enfría significativamente, aumenta sus niveles de RBM3, una molécula conocida como proteína de choque frío, un fenómeno observado por primera vez en animales en hibernación. Se cree que durante la hibernación, la proteína ayuda a proteger el cerebro del daño y le permite continuar formando nuevas conexiones.

En 2015, la profesora Giovanna Mallucci y sus colegas demostraron en ratones que RBM3 puede proteger el cerebro contra el daño asociado con la acumulación de proteínas mal plegadas, lo que puede conducir a diversas formas de demencia, como la enfermedad de Alzheimer y Parkinson, y de enfermedades priónicas como Enfermedad de Creutzfeldt-Jakob (ECJ).

La hipotermia inducida se usa para tratar pacientes en unidades de cuidados intensivos, incluidos bebés recién nacidos y pacientes con lesiones cerebrales traumáticas, con los pacientes en coma y sus cerebros enfriados para protegerlos contra daños. Pero esto viene con riesgos asociados, como la coagulación de la sangre y la neumonía. ¿Se podría aprovechar la proteína de choque frío para tratar a los pacientes sin tener que enfriar el cuerpo, ofreciendo un tratamiento más seguro para la lesión cerebral aguda o una forma de proteger el cerebro contra la demencia?

En una investigación publicada en EMBO Molecular Medicine, científicos del Instituto de Investigación de la Demencia del Reino Unido, la Universidad de Cambridge y el Instituto de Química y Bioquímica de la Freie Universität Berlin, estudiaron si una forma de terapia génica conocida como oligonucleótidos antisentido (ASO) podría aumentar los niveles de la proteína de choque frío en el cerebro de los ratones y, por lo tanto, protegerlos.

El equipo examinó el gen que codifica la producción de la proteína de choque frío y descubrió que contiene un elemento clave que, en condiciones normales, impide su expresión. Eliminar o ‘reducir’ este elemento mediante un ASO da como resultado un impulso duradero en la producción de RBM3.

Para probar si este enfoque podría proteger el cerebro, los investigadores utilizaron ratones infectados con priones. A algunos de estos ratones se les inyectó una dosis única de ASO tres semanas después, mientras que a los demás se les administró un tratamiento de control.

Doce semanas después de que se les administraran los priones, los ratones que habían recibido el tratamiento de control sucumbieron a la enfermedad priónica y mostraron una gran pérdida de neuronas en el hipocampo, un área del cerebro importante para la memoria.

La historia fue muy diferente para los ratones que habían recibido el ASO. Al mismo tiempo que los otros ratones sucumbían a la enfermedad priónica, los ratones tratados con ASO tenían niveles de RBM3 dos veces más altos que en los otros ratones. Siete de los ocho ratones tratados con ASO mostraron una gran preservación de las neuronas en el hipocampo.

La profesora Giovanna Mallucci, quien dirigió el trabajo mientras trabajaba en el Instituto de Investigación de la Demencia del Reino Unido en la Universidad de Cambridge, dijo: «Esencialmente, la proteína de choque frío permite que el cerebro se proteja a sí mismo, en este caso, contra el daño a las células nerviosas en el cerebro. durante la enfermedad priónica. Sorprendentemente, demostramos que una sola inyección con ASO fue suficiente para proporcionar una protección duradera para estos ratones, previniendo la inevitable progresión de la neurodegeneración”.

El profesor Florian Heyd de la Freie Universität Berlin agregó: “Este enfoque ofrece la posibilidad de poder proteger contra enfermedades como el Alzheimer y el Parkinson, para las cuales no tenemos tratamientos preventivos confiables.

“Todavía estamos muy lejos de esta etapa ya que nuestro trabajo fue en ratones, pero si podemos usar ASO de manera segura para aumentar la producción de la proteína de choque frío en humanos, podría ser posible prevenir la demencia. Ya estamos viendo que los ASO se utilizan para tratar con éxito la atrofia muscular espinal y recientemente obtuvieron la licencia para tratar la enfermedad de la neurona motora”.

Si los hallazgos se pueden replicar en humanos, este enfoque podría tener implicaciones importantes para el tratamiento de pacientes más allá de la neurodegeneración. Estos incluyen lesiones cerebrales agudas de bebés recién nacidos con hipoxia a través de la protección del cerebro en cirugía cardíaca, accidentes cerebrovasculares y lesiones en la cabeza en adultos que de otro modo serían tratados con hipotermia terapéutica.

El profesor Mallucci ahora trabaja en Alto Labs, Instituto de Ciencias de Cambridge.

La investigación fue financiada con fondos básicos de la Freie Universität Berlin y del Instituto de Investigación de la Demencia del Reino Unido, que a su vez está financiado por el Consejo de Investigación Médica, la Sociedad de Alzheimer y la Investigación de Alzheimer del Reino Unido.

Referencia
Preussner, M et al. ASO dirigido al empalme de exón de veneno RBM3 controlado por temperatura previene la neurodegeneración in vivo. EMBO Medicina Molecular; 22 de marzo de 2023; DOI: 10.15252/emmm.202217157

La Universidad de Leeds lanza una Maestría en Ciencias de Datos (Estadística) en Coursera

Por Coursera

La plataforma de aprendizaje en línea, Coursera, se enorgullece de anunciar una nueva Maestría en Ciencias (MSc) en Ciencia de Datos (Estadística) de la Universidad de Leeds, una de las instituciones de educación superior más grandes del Reino Unido y reconocida entre las 100 universidades líderes en todo el mundo.

El programa de grado, desarrollado en colaboración con la Escuela de Matemáticas y el Instituto de Análisis de Datos de Leeds (LIDA), equipará a los estudiantes con habilidades de datos en demanda y los preparará para carreras en atención médica, ciencias ambientales y otros campos STEM basados ​​en datos. .

Las profesiones relacionadas con la ciencia de datos ya tienen una gran demanda y es probable que aumenten aún más en los próximos años. De hecho, se estima que la industria global de análisis de datos crecerá más del 500 % para 2030. Aquellos con habilidades y calificaciones técnicas, como la Maestría en Ciencias de Datos de la Universidad de Leeds, estarán bien posicionados para el futuro mercado laboral.

El Máster ofrece cursos básicos de ciencia de datos y cursos especializados de estadística. Los estudiantes desarrollarán una variedad de habilidades, incluida la competencia en lenguajes de programación clave, la capacidad de analizar grandes conjuntos de datos y una comprensión del manejo y la gobernanza de datos. El curso incluye proyectos prácticos, lo que permite a los estudiantes demostrar sus habilidades a posibles empleadores y prepararse para puestos de alto nivel en los sectores empresarial, gubernamental y sin fines de lucro.

Maestro. Jeff Grabill, Vicerrector Adjunto de Educación Estudiantil, dijo: “Este es un ejemplo fantástico de nuestra inversión en tecnologías digitales y nuestro compromiso de hacer crecer nuestra cartera de educación completamente en línea para beneficiar a los estudiantes de todo el mundo. Tenemos una estrategia ambiciosa para transformar el aprendizaje de los estudiantes, y al ofrecer cursos completamente en línea como este MSc en Data Science, podemos brindarles a las personas que nunca podrían poner un pie en el campus la oportunidad de experimentar nuestra enseñanza e investigación de alto nivel. . Nuestro objetivo es eliminar los límites del aprendizaje, y la educación digital nos permite relacionarnos con el mundo de una manera diferente, y se suma a las oportunidades de aprendizaje ya excepcionales que ya están disponibles en la Universidad de Leeds”.

Marni Baker Stein, directora de contenido de Coursera, dijo: “Este programa de grado ofrece una gran oportunidad para que los estudiantes adquieran las habilidades altamente buscadas que son indispensables en la fuerza laboral centrada en los datos de hoy. Al ofrecer este título en línea, lo abrimos a todos nuestros estudiantes en todo el mundo y permitimos que más personas obtengan una educación de clase mundial. Este programa ofrece una experiencia educativa transformadora que no solo es accesible sino que también se adapta a las demandas cambiantes de la industria”.

El MSc en línea permite a los estudiantes participar de forma remota en una experiencia de aprendizaje interactiva y atractiva. Los estudiantes pueden conectarse con profesores y compañeros a través de contenido en línea asíncrono y en vivo, como debates, actividades y tutorías. El programa también permite a los estudiantes probar cursos abiertos relacionados con el título antes de presentar la solicitud, y cualquier progreso realizado cuenta para el título completo.

La Universidad de Leeds es reconocida como una de las 100 mejores universidades del mundo y esta asociación con Coursera permitirá a los estudiantes de todo el mundo acceder a su experiencia de clase mundial y adquirir valiosas habilidades en demanda que los prepararán mejor para carreras STEM.

Las aplicaciones están abiertas
Las solicitudes para la maestría ya están abiertas, y la primera cohorte comenzará en enero de 2024. Para obtener detalles del programa y comenzar la solicitud, visite: Coursera.org/degrees/msc-data-science-ul/. Además, obtenga más información sobre el curso de la Universidad de Leeds: https://courses.leeds.ac.uk/d052/data-science-statistics-msc.

Cambridge domina un fin de semana de deporte universitario

Buscar noticias

Regístrese para recibir nuestro boletín

El resumen de noticias de la Universidad resume noticias de y sobre la Universidad de Cambridge. Ingrese su dirección de correo electrónico, confirme que está feliz de recibir nuestros correos electrónicos y luego seleccione ‘Suscribirse’.

La Universidad de Cambridge utilizará su dirección de correo electrónico para enviarle nuestro resumen de noticias de la Universidad hasta tres veces por semana. Estamos comprometidos a proteger su información personal y ser transparentes sobre la información que tenemos. Lea nuestro aviso de privacidad de correo electrónico para obtener más detalles.

Claire tomó su talento para escribir y su pasión por la experiencia del usuario y lo convirtió en una carrera floreciente

Conoce a Claire, una nativa sudafricana que aprende en Kilkenny, Irlanda. Claire tiene más de 13 años de experiencia trabajando en un entorno SaaS como escritora técnica principal polivalente y creadora de contenido web, pero esa no siempre fue la carrera que eligió. Obtenga más información sobre cómo Claire ha utilizado los cursos de Coursera para ayudar a mejorar sus habilidades en cada fase de su trayectoria profesional.

¡Hola, soy Clara! Déjame guiarte a través de mi diversa trayectoria profesional. Cuando era más joven, tenía aspiraciones de enseñar, así que en la universidad me especialicé en inglés y me gradué no solo con mi licenciatura, sino también con una maestría. Conseguí un trabajo como profesor de inglés en una escuela secundaria en Sudáfrica. Sin embargo, no estaba cumpliendo los deseos que tenía para mí y mi carrera. Decidí hacer un cambio de carrera hacia la redacción y creación de contenido y conseguí un trabajo como creador de contenido académico. Esto combinó mi pasión por la redacción publicitaria, las redes sociales y la educación.

Después de que terminó mi contrato para ese puesto, comencé a buscar puestos en los que pudiera escribir contenido educativo en el campo técnico. Tuve la suerte de conseguir un trabajo en Adobe, una gran empresa de desarrollo de software, como líder de contenido técnico. En ese rol, creé una base de datos en línea, desarrollé un programa de contenido para un proyecto beta en la nube, redacté propuestas de UX e informé sobre análisis y rastreo de contenido en el Centro de soporte de Adobe. Para mejorar mis habilidades técnicas y la atención al cliente, me inscribí en mis primeros tres cursos en Coursera: Primeros pasos con la empatía Mapeo de la experiencia del usuario en Miro, Introducción a HTML y Fundamentos del diseño de la experiencia del usuario (UX) de Google.

A través de esos cursos, aprendí a comprender mejor y empatizar con la experiencia del usuario (UX) y diseñar páginas web utilizando código HTML.

En octubre de 2022, dejé mi puesto de contrato garantizado en Adobe para ocupar un puesto de redactor técnico principal a tiempo completo en Keelvar. Ahora estoy completando mis habilidades completando aún más cursos: iniciar el proceso de diseño de UX: empatizar, definir e idear, realizar investigaciones de UX y probar conceptos tempranos, y construir estructuras de alambre y prototipos de baja fidelidad, todo de Google también. Sin embargo, la cuestión es que, una vez que empiezas, ¿puedes parar alguna vez? Con tantos caminos por explorar y opciones por descubrir, ¡quién sabe adónde me llevará mi carrera!

Todos tenemos fortalezas, pero lo que descubrí con estos cursos es que mis fortalezas ahora se han convertido en habilidades que puedo aplicar a muchas facetas de mi carrera y mi vida. Tengo un amor profundo por el viaje del usuario y un corazón genuino por las personas y lo que experimentan. Con más de una década escribiendo para empresas de SaaS, poder canalizar estas pasiones en mi trabajo a través del mapeo de empatía y el proceso de diseño de UX me ha ayudado a comprender para quién escribo y por qué. Ya no veo un documento o una guía de interfaz de usuario como una simple tarea, sino como una oportunidad para hacer la vida de otra persona más fácil y sencilla. Si puedo escribir según las necesidades de un usuario, la empresa en su conjunto solo puede crecer y beneficiarse de los clientes que se sienten comprendidos.

Coursera es un aprendizaje fácil y divertido. Desde suscripciones anuales a precios increíbles hasta financiación individual por curso: este es tu momento de ser el cambio que estabas tan desesperado por ver. Para los estudiantes, los dejo con esto:

Esfuérzate, puedes hacerlo y lo harás. Cualquiera que creas que son tus límites, ve más allá. Eres más de lo que crees que eres, y hay todo un mundo esperando que dejes tu huella.

Alcanzarla. Él. Es tuyo.

Encontrar nuevas formas de diagnosticar los tumores cerebrales infantiles

La nieta de John Huggins, Sophie Harper, fue diagnosticada con meduloblastoma en 2006.

John dijo: “Hasta la edad de diecinueve meses, Sophie parecía ser una niña con un desarrollo normal, caminaba a los once meses y su habla estaba muy por delante de su edad. A partir de los diecinueve meses empezó a vomitar regularmente y cuando su madre la llevó al médico al cuarto día, le diagnosticaron un virus. Después de diez días, mi hija volvió al médico, pero nuevamente dijo que era un virus. Sophie fue llevada al médico varias veces durante los siguientes dos meses y medio y no hubo cambios en el diagnóstico del médico. Entonces, Sophie comenzó a perder su capacidad para caminar, ya no era la niña feliz que era, se quejaba de dolor de cabeza, comenzó a caerse con frecuencia y quería que la llevaran en brazos. Fue solo entonces que el médico accedió a que Sophie se hiciera una exploración”.

La exploración de Sophie se llevó a cabo en el Hospital Universitario de Norwich y reveló una masa en su cerebelo. La trasladaron al Addenbrooke’s Hospital, Cambridge, para realizar más pruebas y se confirmó un tumor meduloblastoma.

John dijo: “Ninguno de nosotros tenía ningún conocimiento sobre los tumores cerebrales y se convirtió en una gran curva de aprendizaje. En ese momento, mamá y papá tuvieron que decidir si tomar la opción de cuidados curativos o paliativos. Sophie siempre tuvo una gran personalidad y fue muy luchadora con cualquier enfermedad, por lo que mamá y papá decidieron que tenían que darle las herramientas para luchar y tomar la opción curativa”.

La semana siguiente, Sophie se sometió a una operación para tratar de extirpar el tumor y la familia esperaba ansiosa en el jardín del Hospital de Addenbrooke por noticias. Se esperaba que la operación durara entre tres y cuatro horas, pero Sophie estuvo en cirugía durante siete y media.

John dijo: “Sophie no recuperó el conocimiento durante treinta y dos días, debido al daño a su cerebro. Pasó tres meses en cuidados intensivos y ahora necesitaba un suplemento de oxígeno y tenía que ser alimentada a través de un tubo de gastrostomía. Ambos se quedarían durante los próximos seis años de su vida.

“También quedó claro que había otros efectos secundarios de la operación: su habla se vio significativamente afectada y no podía sostener nuestra mirada y sus movimientos eran descoordinados y torpes. Durante el tiempo de su tratamiento recibió más de cien transfusiones de productos sanguíneos debido a los bajos recuentos de células sanguíneas, pero ninguno de nosotros puede recordar un solo día en el que no nos hiciera reír o alegrarnos el día. Tenía una habilidad increíble para hacer eso.

“Es cierto que la cirugía tuvo un efecto dramático en Sophie, ya no era la niña que conocíamos antes de la operación”.

Justo antes del octavo cumpleaños de Sophie, su familia quedó devastada cuando un escáner reveló otro crecimiento en su cerebro. Le dieron tres meses de vida, pero sobrevivió casi un año y lamentablemente murió poco antes de cumplir nueve años en 2013.

Después de su muerte, la familia de Sophie creó The Sophie Elin Harper Fund con The Brain Tumor Charity para recaudar fondos y crear conciencia sobre los tumores cerebrales. Su recaudación de fondos hasta la fecha asciende a unas notables 38.000 libras esterlinas.

John dijo: “Los efectos secundarios que Sophie tuvo después de la cirugía, con el insulto a su cerebro, fueron enormes y cambiaron totalmente su vida.

“Sophie vivió una vida muy cruel, dentro y fuera del hospital. Incluso la derivación colocada en su cerebro tuvo que ser reemplazada en tres ocasiones. Nunca recuperó la capacidad de caminar y siempre fue alimentada a través de una sonda de gastrostomía, junto con un suplemento de oxígeno, pero nunca se quejó.

“La posibilidad de evitar efectos secundarios y cirugías innecesarias sería un verdadero punto de inflexión en el tratamiento del meduloblastoma”.

Solución de algas «elegante» gana Cambridge Zero Student Climate Challenge

El discurso ganador del equipo AlgaeSorb persuadió a un panel de expertos en innovación para otorgarles el premio mayor de £ 1500 por una idea, que el juez, el Dr. Nicky Dee, fundador del grupo de capital de riesgo centrado en el clima Carbon13, describió como «elegante».

«El Desafío Climático fue una oportunidad increíble no solo para conocer a estudiantes con ideas afines, sino también para aprender habilidades invaluables en la creación y el diseño de proyectos impulsados ​​por el impacto», dijo Anish Chaluvadi del Equipo AlgaeSorb, becario de Gates-Cambridge y estudiante de doctorado en nanociencia y nanotecnología en King’s. Colega.

El equipo también incluye al estudiante de doctorado en nanociencia y nanotecnología Timothy Lambden (Girton College) y Tristan Spreng, estudiante de maestría en ciencias naturales (Trinity College) y presidente de la Sociedad de Tecnología Energética de la Universidad de Cambridge.

“El Desafío Climático fue uno de los eventos más emocionantes y mejor organizados a los que pude asistir durante mis cuatro años en Cambridge”, dijo Spreng. “Desde la variedad de oradores en las sesiones del seminario hasta el intercambio de ideas con otros participantes durante el lanzamiento y eventos finales, fue una experiencia realmente asombrosa”.

Ocho equipos se reunieron en el edificio Entopia recientemente remodelado del Instituto de Cambridge para el Liderazgo en Sostenibilidad (CISL) para presentar ideas que van desde el uso del aprendizaje automático para crear algoritmos para el riesgo de inundación hasta el procesamiento de datos satelitales para ubicar paneles solares montados en la pared.

El panel de jueces también incluyó al emprendedor en serie Simon Hombersley, el profesor Jaideep Prabhu, el profesor Jawaharlal Nehru de Negocios y Empresas de la India en Cambridge Judge Business School, Lindsay Hooper, directora ejecutiva de CISL y Chris Gibbs de la unidad de transferencia de tecnología de la Universidad Cambridge Enterprise.

El Dr. Dee dijo que AlgaeSorb fue una entrada brillante de un equipo mixto, que se basó en las experiencias y conocimientos de diferentes países en química, física y ciencias de los materiales.

“Como resultado, desarrollaron una solución elegante para abordar el problema del metano en el Sur Global, donde no hay otras soluciones de relleno sanitario disponibles y de una manera que apoye a las comunidades locales”, dijo.

Entre lanzamientos, expertos como el profesor Prabhu y la directora de Cambridge Zero, la profesora Emily Shuckburgh, ofrecieron información sobre la innovación sostenible y su importancia en la carrera para reducir las emisiones de gases de efecto invernadero y mantener las temperaturas globales por debajo de 1,5 grados centígrados.

La Dra. Amy Munro-Faure, Directora de Educación y Compromiso Estudiantil de Cambridge Zero, dirigió un juego rápido que mezcló equipos para lanzamientos espontáneos, lo que resultó en una mezcla salvaje de ideas que incluían salvar delfines y viajar en el tiempo.

El programa Climate Challenge de ocho semanas se ejecuta en asociación con CISL Canopy, Carbon13, Energy IRC, Cambridge Enterprise, Maxwell Center y está patrocinado por Moda Living. Los equipos de la competencia se capacitan y desarrollan propuestas de soluciones en etapas tempranas para abordar los desafíos climáticos de manera innovadora.

Cada año hay un tema nuevo. El tema de este año, “Una transición justa”, pidió a los equipos que consideraran los impactos sociales de sus soluciones climáticas.

Dos equipos subcampeones recibieron un premio de £ 750. FireSight, formado por Jovana Knezevic y Onkar Gulati, lanzó un servicio de consultoría y evaluación de riesgos para abordar los incendios forestales globales utilizando la detección remota y el aprendizaje automático. Carolina Pulignani y Shannon A. Bonke de Wastevalor fascinaron a los jueces con su tecnología que convierte los desechos en metanol.

Team Reckon, formado por Aparna Holenarasipura Sreedhara y Akanksha Sahay, ganó el premio Audience Choice Award por su plataforma de software como servicio. El software brinda a las organizaciones la capacidad de medir el impacto social de sus planes de transición climática.

Los jueces dijeron que el Desafío Climático fue una poderosa demostración de cómo la innovación y la determinación para abordar el cambio climático impregnan todos los niveles de la comunidad de la Universidad de Cambridge.

“Ayudar a construir la mentalidad emprendedora en el ecosistema universitario es fundamental para la agenda de innovación y particularmente crucial para un verdadero cero neto donde más de la mitad de las innovaciones necesarias para 2050 todavía están en el laboratorio”, dijo Gibbs.

Herramientas de ingeniería de datos que las empresas buscan a nivel mundial.

La ingeniería de datos es el proceso de transformar datos sin procesar en cosas que toda empresa quiere y necesita.

Los ingenieros de datos trabajan en una variedad de industrias que crean sistemas que recopilan, administran y convierten estos datos tan valiosos. ¿El objetivo general? Hacer que los datos sean accesibles. Por lo tanto, los profesionales que no son de datos pueden evaluar y optimizar el rendimiento de su empresa de infinitas maneras.

Los ingenieros de datos exitosos tienen sólidas habilidades de programación, conocimientos estadísticos, habilidades analíticas y comprensión de las tecnologías de big data. Y estas habilidades tienen un alto precio para los empleadores. Según Indeed, el salario base promedio de un ingeniero de datos en los EE. UU. es de $128,585.

A medida que las empresas de todo el mundo se vuelven más impulsadas por los datos, las habilidades de ingeniería de datos son un bien de moda. Sin embargo, existe una escasez de profesionales con los conocimientos adecuados para llenar los vacíos de talento. ¿Está interesado en comenzar o avanzar en una carrera en ingeniería de datos? Estas son algunas de las herramientas de ingeniería de datos más populares en el campo:

1. Desplazamiento al rojo de Amazon

Construido por Amazon, este almacén en la nube completamente administrado se basa en un extenso canal de comunicación entre la aplicación del cliente y el clúster del almacén de datos. Es un elemento básico de la industria que impulsa a miles de empresas. Sus algoritmos permiten a los usuarios realizar operaciones en miles de millones de filas. Esto reduce sustancialmente el tiempo de ejecución de comandos.

Microsoft Power BI es una de las herramientas líderes para la ingeniería de datos. Los ingenieros de datos lo utilizan para procesar conjuntos de datos y analizar información para poder crear visualizaciones dinámicas. Es una herramienta fácil de usar: las personas sin conocimientos técnicos pueden usarla para crear informes y tableros sin problemas. Además, es extremadamente asequible. Power BI tiene una versión de escritorio básica y gratuita que puede usar para crear informes y paneles en su PC.

3. BigQuery

Al igual que Redshift, BigQuery es un almacén de datos en la nube sin servidor y completamente administrado. Ayuda a las empresas a gestionar y analizar sus datos con funciones integradas como aprendizaje automático, análisis geoespacial e inteligencia empresarial. Además, es rápido: BigQuery le permite realizar análisis de un conjunto de datos completo en segundos.

4. Cuadro

Esta herramienta de visualización de datos e inteligencia comercial se puede utilizar para aplicaciones comerciales comunes, que incluyen: modelado de datos, creación de paneles en vivo y ensamblaje de informes de datos. Tableau usa una interfaz de arrastrar y soltar para usar datos en diferentes departamentos. El software permite que incluso los usuarios no técnicos creen visualizaciones en cuestión de minutos. Con solo unos pocos clics, las personas pueden combinar fuentes de datos, agregar filtros y más.

5. Copo de nieve

Este almacén como solución se diseñó para satisfacer las necesidades empresariales actuales. Permite a los usuarios cambiar rápidamente a un sistema basado en la nube. Su arquitectura única combina los beneficios de la arquitectura de disco compartido y la arquitectura de nada compartido. Snowflake es una plataforma ideal para el almacenamiento de datos, los lagos de datos, la ingeniería de datos, la ciencia de datos y el desarrollo de aplicaciones de datos, ya que las cargas de trabajo de datos se pueden escalar de forma independiente entre sí.

Python es uno de los lenguajes de programación más populares a nivel mundial. Ayuda a los ingenieros de datos a crear canalizaciones de datos eficientes porque muchas herramientas de ingeniería de datos usan Python en el backend. Funciona con herramientas como Apache Spark, Apache Airflow, NiFi, Luigi, etc. Los ingenieros de datos pueden usar Python para tareas que incluyen: ingesta de datos de diferentes formatos de archivo, adquisición de datos, procesamiento de datos y creación de canalizaciones ETL/ELT.

Si estas herramientas de ingeniería de datos despiertan su interés, considere inscribirse en el programa Ingeniería de datos con AWS Nanodegree de Udacity. Aprenda temas que incluyen: diseño de modelos de datos, creación de almacenes de datos y lagos de datos, automatización de canalizaciones de datos y administración de conjuntos de datos masivos. NOTA: Se recomienda que los alumnos tengan conocimientos intermedios de Python, SQL intermedio y línea de comandos.

Los científicos tienen una nueva herramienta para estimar cuánta agua podría estar oculta debajo de la superficie de un planeta

Científicos de la Universidad de Cambridge ahora tienen una forma de estimar cuánta agua puede almacenar un planeta rocoso en sus depósitos subterráneos. Se cree que esta agua, que está encerrada en la estructura de los minerales en el fondo, podría ayudar a un planeta a recuperarse de su ardiente nacimiento inicial.

Los investigadores desarrollaron un modelo que puede predecir la proporción de minerales ricos en agua dentro de un planeta. Estos minerales actúan como una esponja, absorbiendo agua que luego puede regresar a la superficie y reponer los océanos. Sus resultados podrían ayudarnos a comprender cómo los planetas pueden volverse habitables después de un intenso calor y radiación durante sus primeros años.

Se cree que los planetas que orbitan estrellas enanas rojas de tipo M, la estrella más común de la galaxia, son uno de los mejores lugares para buscar vida extraterrestre. Pero estas estrellas tienen años de adolescencia particularmente tempestuosos, liberando intensos estallidos de radiación que destruyen los planetas cercanos y eliminan el agua de su superficie.

La fase adolescente de nuestro Sol fue relativamente corta, pero las estrellas enanas rojas pasan mucho más tiempo en este angustioso período de transición. Como resultado, los planetas bajo sus alas sufren un efecto invernadero desbocado donde su clima se convierte en un caos.

«Queríamos investigar si estos planetas, después de una crianza tan tumultuosa, podrían rehabilitarse y albergar agua superficial», dijo la autora principal del estudio, Claire Guimond, estudiante de doctorado en el Departamento de Ciencias de la Tierra de Cambridge.

La nueva investigación, publicada en el Avisos mensuales de la Royal Astronomical Society, muestra que el agua interior podría ser una forma viable de reponer el agua superficial líquida una vez que la estrella anfitriona de un planeta haya madurado y atenuado. Esta agua probablemente habría sido traída por los volcanes y liberada gradualmente como vapor a la atmósfera, junto con otros elementos que dan vida.

Su nuevo modelo les permite calcular la capacidad de agua interior de un planeta en función de su tamaño y la química de su estrella anfitriona. “El modelo nos da un límite superior sobre la cantidad de agua que un planeta podría transportar en profundidad, en función de estos minerales y su capacidad para absorber agua en su estructura”, dijo Guimond.

Los investigadores descubrieron que el tamaño de un planeta juega un papel clave para decidir cuánta agua puede contener. Esto se debe a que el tamaño de un planeta determina la proporción de minerales que transportan agua de los que está hecho.

La mayor parte del agua interior de un planeta está contenida dentro de una capa rocosa conocida como manto superior, que se encuentra directamente debajo de la corteza. Aquí, las condiciones de presión y temperatura son las adecuadas para la formación de minerales verde-azulados llamados wadsleyita y ringwoodita que pueden absorber agua. Esta capa rocosa también está al alcance de los volcanes, que podrían traer agua a la superficie a través de erupciones.

La nueva investigación mostró que los planetas más grandes, alrededor de dos o tres veces más grandes que la Tierra, generalmente tienen mantos rocosos más secos porque el manto superior rico en agua constituye una proporción más pequeña de su masa total.

Los resultados podrían proporcionar a los científicos pautas para ayudarlos en la búsqueda de exoplanetas que puedan albergar vida. Astronomía. «Cuando buscamos los planetas que mejor pueden contener agua, probablemente no quieras uno significativamente más masivo o mucho más pequeño que la Tierra».

Los hallazgos también podrían aumentar nuestra comprensión de cómo los planetas, incluidos los más cercanos a casa como Venus, pueden pasar de paisajes infernales estériles a una canica azul. Las temperaturas en la superficie de Venus, que tiene un tamaño y una composición similar a la de la Tierra, rondan los 450°C y su atmósfera está cargada de dióxido de carbono y nitrógeno. Sigue siendo una pregunta abierta si Venus albergó agua líquida en su superficie hace 4 mil millones de años. «Si ese es el caso, entonces Venus debe haber encontrado una manera de enfriarse y recuperar el agua superficial después de nacer alrededor de un sol ardiente», dijo Shorttle, «es posible que haya aprovechado su agua interior para hacer esto».

Referencia:
Guimond, CM, Shorttle, O. y Rudge, JF ‘La mineralogía del manto limita los inventarios de agua de los planetas rocosos’. Avisos mensuales de la Royal Astronomical Society (2023). DOI: 10.1093/mnras/stad148

Python’s eval(): la función más poderosa que nunca deberías usar.

eval() es una función simple y poderosa integrada en el intérprete de Python. Como su nombre lo indica, la función *evalúa* cualquier expresión que se le pase. Este argumento se pasa como una cadena, con argumentos opcionales para globals y localsdónde globals es un diccionario y locals es cualquier objeto de mapeo, generalmente un diccionario. Esto significa con eval(), puede evaluar expresiones arbitrarias de python almacenadas como cadenas. Más detalles sobre eval(), globalsy locals siempre se puede encontrar en la documentación oficial de Python.

Desde eval() es una función tan poderosa, debemos recordar la lección número uno que vale la pena aprender de Spider-man: un gran poder conlleva una gran responsabilidad.

En la práctica, la recomendación más clara es que nunca, nunca, se debe utilizar eval(). Al cumplir con esta recomendación, se asegura de cumplir con las mejores prácticas de codificación.

  • Primero, como práctica recomendada, el comportamiento de su programa debe ser capturado por el propio código, una vez que comience a usar eval()el comportamiento del programa se vuelve mucho menos predecible.

En segundo lugar, aceptar entradas no confiables para eval() puede permitir la ejecución de código arbitrario por parte de usuarios malintencionados. Por ejemplo, un usuario malicioso privilegiado podría pasar la cadena '__import__('subprocess').getoutput('rm -rf /')' para eliminar todo el sistema de archivos, o use una utilidad como netcat para abrir una puerta trasera en la máquina.

En casi todos los casos, uno puede y debe usar Python nativo, o si debe ejecutar cadenas, aprovechar funciones y clases desde el [subprocess module].

Consideremos primero el ejemplo presentado en la documentación oficial:

En este caso, eval() regresará 2. Funcionalmente, esto es equivalente a ejecutar la expresión x + 1.

Entonces, imaginemos que queremos una función que tome un solo argumento, xy devolver el valor x + 1. Esto, por supuesto, es preferible, porque es mucho más seguro que tomar la entrada arbitraria del usuario para eval().

def increment(x):
    return x + 1

Ejemplo de uso

Ahora, consideremos un ejemplo:

# Perimeter of Square
def calculatePerimeter(l):
    return 4*l

# Area of Square
def calculateArea(l):
    return l*l

expression = input("Type a function: ")

for l in range(1, 5):
    if (expression == 'calculatePerimeter(l)'):
        print("If length is ", l, ", Perimeter = ", eval(expression))
    elif (expression == 'calculateArea(l)'):
        print("If length is ", l, ", Area = ", eval(expression))
    else:
        print('Wrong Function')
        break

Este es un uso mucho más complejo de eval(), ¡y parece un uso bastante convincente! Sin embargo, incluso con nuestra verificación de expresiones, pasar la entrada del usuario directamente a eval() puede ser un riesgo significativo para la seguridad y es un mal hábito.

Consideremos cómo podríamos refactorizar esto *no* para usar eval().

# Perimeter of Square
def calculatePerimeter(l):
    return 4*l

# Area of Square
def calculateArea(l):
    return l*l

expression = input("Would you like to compute the area or the perimeter? ")

for l in range(1, 5):
    if (expression == 'perimeter'):
        print(f"If length is {l}, Perimeter = {calculatePerimeter(l)}")
    elif (expression == 'area'):
        print(f"If length is {l}, Area = {calculateArea(l)}")
    else:
        print('Wrong Function')
        break

Simplemente reemplazando la llamada a eval con una llamada de cadena de formato a la función en sí y reformulando la pregunta, evitamos adquirir el hábito de llamar a funciones peligrosas como eval().

Limitar la ejecución con globals y locals

¿Qué pasa si estás atascado con eval() ¿por alguna razón? ¡O tal vez no tengas miedo y estés feliz de ignorar las advertencias de no usarlo! Bueno, en esos casos, es importante entender cómo globals y locals trabajar.

Como mencionamos (¡y como puede encontrar en la documentación!), globals debe ser un pitón dict() objeto. Este diccionario es análogo al devuelto por el globals() función integrada y consta de global variables configuradas en el programa asignadas a su valor. Al restringir el acceso a un subconjunto del diccionario de variables globales, la funcionalidad de eval() se reduce ligeramente.

Similarmente, locals es un mapeo de variables de alcance local, generalmente un diccionario, que se puede especificar para restringir la llamada de eval() a un conjunto más pequeño de variables locales. Al pasar diccionarios vacíos a ambos globals y locals, eval() no puede acceder a los valores almacenados en otras partes del programa, algo que ciertamente reduce su poder.

Conclusión

Aunque usando eval() se desaconseja, es una función importante de entender. Es una de las pocas funciones integradas que no necesita importarse desde un módulo o la biblioteca estándar y, para bien o para mal, puede encontrarla cuando se trata de código heredado o mal mantenido.

En la mayoría de los casos, ser cuidadoso con la creación de su código puede permitirle solucionarlo, pero en los casos en que debe usarse, validar la entrada a la función y usar restricciones globals y locals puede hacerlo más tolerable. si vas a eval()¡hazlo con responsabilidad!

¿Busca ampliar su conocimiento de Python? La programación de Udacity para la ciencia de datos con Python Nanodegree le enseñará los fundamentos de Python para ayudarlo a prepararse para una carrera en ciencia de datos. Si ya está familiarizado con los conceptos básicos de Python, tome el programa Intermediate Python Nanodegree de Udacity para obtener habilidades de programación de nivel profesional.

Olas submarinas gigantes afectan la capacidad del océano para almacenar carbono

Un equipo internacional de investigadores, dirigido por la Universidad de Cambridge, la Universidad de Oxford y la Universidad de California en San Diego, cuantificó el efecto de estas olas y otras formas de turbulencia submarina en el Océano Atlántico y descubrió que su importancia no está siendo reflejado con precisión en los modelos climáticos que informan la política gubernamental.

El océano absorbe la mayor parte del calor y el carbono emitidos por la actividad humana, pero la cantidad que puede absorber depende de la turbulencia en el interior del océano, ya que el calor y el carbono son empujados hacia las profundidades del océano o atraídos hacia la superficie.

Si bien estas ondas submarinas ya son bien conocidas, su importancia en el transporte de calor y carbono no se comprende completamente.

Los resultados, publicados en la revista Adelantos AGUmuestran que la turbulencia en el interior de los océanos es más importante para el transporte de carbono y calor a escala global de lo que se había imaginado previamente.

La circulación oceánica transporta aguas cálidas desde los trópicos hasta el Atlántico Norte, donde se enfrían, se hunden y regresan hacia el sur en las profundidades del océano, como una cinta transportadora gigante. La rama atlántica de este patrón de circulación, llamada Circulación de Vuelco Meridional del Atlántico (AMOC, por sus siglas en inglés), juega un papel clave en la regulación de los balances globales de calor y carbono. La circulación oceánica redistribuye el calor a las regiones polares, donde derrite el hielo, y el carbono a las profundidades del océano, donde puede almacenarse durante miles de años.

«Si tuviera que tomar una fotografía del interior del océano, vería una gran cantidad de dinámicas complejas en funcionamiento», dijo la primera autora, la Dra. Laura Cimoli, del Departamento de Matemáticas Aplicadas y Física Teórica de Cambridge. «Debajo de la superficie del agua, hay chorros, corrientes y olas; en las profundidades del océano, estas olas pueden tener hasta 500 metros de altura, pero rompen como una ola en la playa».

«El Océano Atlántico es especial en la forma en que afecta el clima global», dijo el coautor, el Dr. Ali Mashayek, del Departamento de Ciencias de la Tierra de Cambridge. “Tiene una fuerte circulación de polo a polo desde sus tramos superiores hasta las profundidades del océano. El agua también se mueve más rápido en la superficie que en las profundidades del océano”.

Durante las últimas décadas, los investigadores han estado investigando si la AMOC puede ser un factor que explica por qué el Ártico ha perdido tanta cubierta de hielo, mientras que algunas capas de hielo de la Antártida están creciendo. Una posible explicación de este fenómeno es que el calor absorbido por el océano en el Atlántico Norte tarda varios cientos de años en llegar a la Antártida.

Ahora, utilizando una combinación de sensores remotos, mediciones basadas en barcos y datos de flotadores autónomos, los investigadores dirigidos por Cambridge han descubierto que el calor del Atlántico Norte puede llegar a la Antártida mucho más rápido de lo que se pensaba anteriormente. Además, la turbulencia dentro del océano, en particular las grandes olas submarinas, juega un papel importante en el clima.

Como un pastel gigante, el océano está formado por diferentes capas, con agua más fría y densa en el fondo y agua más cálida y ligera en la parte superior. La mayor parte del transporte de calor y carbono dentro del océano ocurre dentro de una capa en particular, pero el calor y el carbono también pueden moverse entre capas de densidad, trayendo aguas profundas de regreso a la superficie.

Los investigadores descubrieron que el movimiento de calor y carbono entre capas se ve facilitado por turbulencias a pequeña escala, un fenómeno que no está completamente representado en los modelos climáticos.

Las estimaciones de mezcla de diferentes plataformas de observación mostraron evidencia de turbulencia a pequeña escala en la rama superior de la circulación, de acuerdo con las predicciones teóricas de las olas internas oceánicas. Las diferentes estimaciones mostraron que la turbulencia afecta principalmente a la clase de capas de densidad asociadas con el núcleo de las aguas profundas que se mueven hacia el sur desde el Atlántico Norte hasta el Océano Austral. Esto significa que el calor y el carbono transportados por estas masas de agua tienen una alta probabilidad de moverse a través de diferentes niveles de densidad.

“Los modelos climáticos dan cuenta de la turbulencia, pero principalmente en cómo afecta la circulación oceánica”, dijo Cimoli. «Pero hemos descubierto que la turbulencia es vital por derecho propio y juega un papel clave en la cantidad de carbono y calor que absorbe el océano y dónde se almacena».

“Muchos modelos climáticos tienen una representación demasiado simplista del papel de la turbulencia a microescala, pero hemos demostrado que es importante y debe tratarse con más cuidado”, dijo Mashayek. “Por ejemplo, la turbulencia y su papel en la circulación oceánica ejerce un control sobre la cantidad de calor antropogénico que llega a la capa de hielo antártica y la escala de tiempo en la que eso sucede”.

La investigación sugiere una necesidad urgente de instalar sensores de turbulencia en matrices de observación globales y una representación más precisa de la turbulencia a pequeña escala en modelos climáticos, para permitir a los científicos hacer proyecciones más precisas de los efectos futuros del cambio climático.

La investigación fue apoyada en parte por el Consejo de Investigación del Medio Ambiente Natural (NERC), parte de Investigación e Innovación del Reino Unido (UKRI).

Referencia:
Laura Cimoli et al. ‘Importancia de la mezcla diapicnal dentro de la circulación de vuelco Meridional del Atlántico.’ Avances AGU (2023). DOI: 10.1029/2022AV000800