Skip to main content
L’analyse transforme le fichier brut en table typée. Elle a quatre parties :

Parser

L’objet parser sélectionne un lecteur (type) et le configure.

Options communes

Options CSV

encoding (ex. utf-8, iso-8859-1), delimiter (,, ;, \t, |…), has_header.

Options Excel

sheet_names (tableau, ou null pour toutes les feuilles), plus section_context pour les fichiers où les données sont groupées sous des en-têtes de sections :
Chaque valeur d’en-tête de section reconnue est reportée sur les lignes en dessous, dans la colonne de sortie nommée.

Options SAV (Polaris)

sql_filename (chemin vers le dump SQL dans l’archive, ex. 0-full.sql), tables (noms de table à extraire), extract_media (extraire les ressources binaires).

Mapping de colonnes

mapping.columns mappe chaque colonne source à un champ cible et un type Spark SQL :
type est n’importe quel type Spark SQL (une chaîne libre, pas un enum figé). Valeurs courantes : STRING, INT, LONG, DOUBLE, TIMESTAMP.

Champs supplémentaires

Les colonnes non mappées sont traitées par extra_fields.mode :

Validation

Garde-fous appliqués après l’analyse :
  • required_columns — doivent être présentes et non nulles.
  • min_rows — nombre de lignes minimum.
Les colonnes analysées s’écoulent ensuite dans le pipeline de promotion, où elles sont transformées et écrites dans silver/gold.