Analysis
DataVec data analysis tools — profiling datasets, detecting quality issues, and computing statistics locally and on Spark
Local analysis
import org.datavec.local.transforms.AnalyzeLocal;
import org.datavec.api.records.reader.impl.csv.CSVRecordReader;
import org.datavec.api.split.FileSplit;
import org.datavec.api.transform.analysis.DataAnalysis;
import org.datavec.api.transform.analysis.DataQualityAnalysis;
Schema schema = new Schema.Builder()
.addColumnString("Name")
.addColumnDouble("Score")
.addColumnInteger("Age")
.build();
RecordReader rr = new CSVRecordReader(1, ',');
rr.initialize(new FileSplit(new File("data.csv")));
int maxHistogramBuckets = 10;
DataAnalysis analysis = AnalyzeLocal.analyze(schema, rr, maxHistogramBuckets);
System.out.println(analysis);Quality analysis
AnalyzeLocal API
AnalyzeLocal APISpark analysis
Extracting min and max
Sampling values
AnalyzeSpark API
AnalyzeSpark APIAnalysis result types
DataAnalysis
ColumnAnalysis implementations
Class
Applies to
DataQualityAnalysis
SequenceDataAnalysis
Workflow: analyze then transform
Last updated
Was this helpful?