The most-used module in the library, covering the full data preparation workflow — from first look to analysis-ready dataset.
18 functions
Data Processing
Clean, transform, and prepare data for analysis.
Functions
AddDateNumberColumns
Add temporal components (year, quarter, month, day, day of week) as separate columns to a DataFrame.
AddLeadingZeros
Pad numeric or string values with leading zeros to achieve a fixed string length.
AddRowCountColumn
Add a sequential row count column within groups based on specified sorting criteria.
AddTPeriodColumn
Calculate elapsed time periods from the earliest date in a DataFrame.
AddTukeyOutlierColumn
Identify and flag statistical outliers using Tukey's IQR fence method.
CleanTextColumns
Remove leading and trailing whitespace from all string columns in a DataFrame.
ConductAnomalyDetection
Detect multivariate anomalies using z-score based probability analysis.
ConductEntityMatching
Match and link records across two DataFrames using fuzzy string matching algorithms.
ConvertOddsToProbability
Convert odds to probability values in a pandas DataFrame.
CountMissingDataByGroup
Calculate the count of missing values within specified groups.
CreateBinnedColumn
Discretize continuous numeric data into discrete bins using specified strategies.
CreateDataOverview
Generate a comprehensive technical summary and data dictionary for a DataFrame.
CreateRandomSampleGroups
Randomly assign DataFrame records to a specified number of groups.
CreateRareCategoryColumn
Consolidate low-frequency categorical values into a single catch-all category.
CreateStratifiedRandomSampleGroups
Partition a DataFrame into balanced groups using stratified random assignment.
GeocodeUSAddresses
Geocode U.S. addresses into latitude and longitude coordinates using the U.S. Census Bureau service.
ImputeMissingValuesUsingNearestNeighbors
Fill missing numeric data using K-Nearest Neighbors imputation.
VerifyGranularity
Verify and enforce a unique level of granularity for a DataFrame.