apache-spark

Вопросы

Каков наиболее эффективный способ чтения паркетного файла с разделами с помощью pyspark?

admin
Я работаю с паркетными файлами, хранящимися в ведрах AWS S3. Они имеют размер несколько ТБ и разделены числовым столбцом, содержащим целочисленные значения от 1 до...
Вопросы

Отсутствующие метрики для конвейера Apache Beam (через SparkRunner / Dataproc)

admin
В настоящее время я добавляю некоторые метрики в существующий конвейер, который работает в Google Dataproc через Spark Runner, и я пытаюсь определить, как получить доступ...
Вопросы

Scala Spark Read from AWS S3 — com.amazonaws.SdkClientException: невозможно загрузить учетные данные из конечной точки службы

admin
В настоящее время я пытаюсь выполнить простое чтение из настроенного мной ведра S3, используя Spark 3.0.0 (реализация через Scala 2.12.10). Однако при отправке скрипта я...