vector_cosine_similarity

Restituisce la somiglianza del coseno tra due vettori float. I vettori devono avere la stessa dimensione.

Per la funzione SQL di Databricks corrispondente, vedere vector_cosine_similarity funzione.

Sintassi

from pyspark.sql import functions as dbf

dbf.vector_cosine_similarity(left=<left>, right=<right>)

Parameters

Parametro Tipo Description
left pyspark.sql.Column o il nome della colonna Prima colonna vettoriale.
right pyspark.sql.Column o il nome della colonna Seconda colonna vettoriale.

Returns

pyspark.sql.Column: somiglianza coseno come valore float.

Esempi

from pyspark.sql import functions as dbf
from pyspark.sql.types import ArrayType, FloatType, StructType, StructField

schema = StructType([StructField('a', ArrayType(FloatType())), StructField('b', ArrayType(FloatType()))])
df = spark.createDataFrame([([1.0, 2.0, 3.0], [4.0, 5.0, 6.0])], schema)
df.select(dbf.vector_cosine_similarity('a', 'b')).first()[0]
# 0.974631...