En el mundo del aprendizaje automático, la capacidad de procesar y analizar grandes cantidades de datos es fundamental para la toma de decisiones inteligentes. Sin embargo, la conversión de estos datos en un lenguaje que los ordenadores puedan entender es un desafío. Gracias al álgebra lineal, podemos traducir estos inputs en un lenguaje matemático que permita la computación eficiente y la optimización a gran escala.
En el vídeo «How Linear Algebra Powers Machine Learning ML», se explora cómo el álgebra lineal proporciona el marco para representar, manipular y transformar datos en un formato adecuado para la computación. Los ordenadores pueden procesar imágenes, textos, audios o videos directamente como los seres humanos, pero necesitamos traducir estos inputs en un lenguaje que puedan entender, es decir, matemáticas.
La transición de los datos brutos a objetos matemáticos a través de la factorización es un proceso fundamental en el álgebra lineal. Los datos se expresan como objetos como escalar, vector, matriz o tensor, en un formato que un ordenador pueda procesar y razonar sobre. Los tensors, por ejemplo, generalizan esta idea en un espacio dimensional aún más alto que 3D y se utilizan para representar datos en TensorFlow.
La distancia euclídea y la similaridad coseno son dos de las operaciones más importantes en álgebra lineal. La distancia euclídea es una medida numérica entre dos vectores que computa la similitud entre cada dimensión y la suma de todas las dimensiones, mientras que la similaridad coseno mide el ángulo entre los dos vectores y se utiliza para medir la similitud entre dos oraciones.
El álgebra lineal también proporciona la base para el entrenamiento de modelos de ML en la práctica. Los modelos de LLMs modernos se entrenan en billones y billones de tokens, y las computaciones utilizando todas las dimensiones son imprácticas e ineficientes. En su lugar, los algoritmos de reducción de dimensionalidad, como la descomposición en valores singulares (SVD), nos permiten realizar la factorización de matrices y reducir la dimensionalidad y destacar la estructura más informativa dentro de los datos.
En resumen, el álgebra lineal es fundamental en el aprendizaje automático, ya que proporciona el marco para representar, manipular y transformar datos en un formato adecuado para la computación. Convierte los datos brutos en representaciones numéricas estructuradas, permite la computación eficiente a través de operaciones de matriz y apoya la optimización a gran escala a través de bibliotecas modernas, como PyTorch y TensorFlow.
Fuente: YouTube



