Si has transferido datos desde una fuente de almacén de datos o lago de datos en Google Cloud y quieres asegurarte de que todo salió bien, este artículo es para ti. En nuestro último vídeo, exploramos cómo validar y optimizar tus cargas de trabajo después de una migración exitosa.
Una de las formas más fáciles de asegurarte de que tus datos se han transferido con éxito es mediante validaciones automatizadas. Los servicios de migración de BigQuery validan las coincidencias estructurales para descubrir datos faltantes, coincidencias de contenido para descubrir datos mutados o incorrectos y fidelidad de tipo para verificar la precisión del esquema. Los resultados de una validación se almacenan en contenedores de almacenamiento y contendrán datos de muestra, consultas generadas y resúmenes de validación para que puedas identificar y corregir fácilmente registros faltantes.
Lo que resulta interesante es que una vez que sepas que todos los datos se han transferido con éxito, puedes pasar a verificar que también se han migrado correctamente las gobernanza y los controles de acceso. Google Cloud tiene herramientas excelentes para ayudarte con la gobernanza de datos, control de acceso granular, calidad de datos y metadatos.
Llama la atención cómo las técnicas de cifrado disponibles y las características de prevención de pérdida de datos se vuelven muy útiles en este proceso. Con una base segura en lugar, el siguiente paso es validar cargas de trabajo adyacentes como tuberías de ETL, aplicaciones comerciales y capas de informes. Es un buen momento para empezar a involucrar a los usuarios comerciales y hacerlos entusiasmarse con todo el potencial desbloqueado para la innovación.
A medida que las cargas de trabajo se estabilizan, encontrarás aspectos para afinar y optimizar aún más en tus cargas de trabajo. Las mejores optimizaciones serán incrementales y basadas en las capacidades y la arquitectura de la nueva infraestructura. Confía en mí, esto no es el momento de reconstruir tus cargas de trabajo desde cero. Comienza con los cambios que pueden ser más fáciles de implementar.
Por ejemplo, el agrupamiento y la partición son una fácil ganancia y también son factores importantes en reducir la cantidad de registros escaneados, lo que mejora el rendimiento y reduce los costos. De manera similar, reducir las uniones en BigQuery suele ser una buena idea. Así que las tablas normalizadas utilizando campos anidados y repetidos son un buen patrón para aplicar cuando sea posible.
Mientras estás integrando en tu nuevo almacén de datos o lago de datos, evita un común escollo y considera si tus patrones actuales siguen siendo adecuados para tus necesidades y la nueva infraestructura. Por ejemplo, ¿el EDL sigue siendo mejor que el ELT? Otro común escollo es sobreestimar la necesidad de datos en tiempo real. ¿Sus usuarios seguirán necesitando datos en streaming o será suficiente con la ejecución en batch?
Si tus integraciones se configuraron hace algún tiempo, puede que ahora haya nuevas premisas y herramientas, así como más potencial para desbloquear. Probablemente tengas alguna visión de esto desde los informes de servicios de evaluación. Hablando de modernización, si esto no es la práctica actual, considera el camino hacia las tuberías de CI/CD y el codificación asistida por inteligencia artificial para tus desarrolladores.
Por último, pero no menos importante, recuerda que hablamos sobre el costo de propiedad y ejecución en nuestro primer video. Asegúrate de que te mantengas dentro del presupuesto y apliques algunas barreras y límites a cómo se procesa y se consulta tu datos. Tu equipo de expertos de Google Cloud puede ayudarte a elegir la edición correcta de BigQuery y asignar reservas en proyectos para tus estimaciones inicial.
Espero que te sientas listo para tu migración y recuerda que hay muchos expertos en Google Cloud dispuestos a ayudarte. ¡Tienes esto!
Fuente: YouTube



