Nota:
El acceso a esta página requiere autorización. Puede intentar iniciar sesión o cambiar directorios.
El acceso a esta página requiere autorización. Puede intentar cambiar los directorios.
Devuelve la similitud coseno entre dos vectores float. Los vectores deben tener la misma dimensión.
Para obtener la función SQL de Databricks correspondiente, consulte vector_cosine_similarity function.
Sintaxis
from pyspark.sql import functions as dbf
dbf.vector_cosine_similarity(left=<left>, right=<right>)
Parameters
| Parámetro | Tipo | Descripción |
|---|---|---|
left |
pyspark.sql.Column o nombre de columna |
Primera columna vectorial. |
right |
pyspark.sql.Column o nombre de columna |
Segunda columna vectorial. |
Returns
pyspark.sql.Column: similitud de coseno como un valor float.
Ejemplos
from pyspark.sql import functions as dbf
from pyspark.sql.types import ArrayType, FloatType, StructType, StructField
schema = StructType([StructField('a', ArrayType(FloatType())), StructField('b', ArrayType(FloatType()))])
df = spark.createDataFrame([([1.0, 2.0, 3.0], [4.0, 5.0, 6.0])], schema)
df.select(dbf.vector_cosine_similarity('a', 'b')).first()[0]
# 0.974631...