PROFESSIONAL SUMMARY
Overview
Work History
Education
Skills
Certification
Languages
Timeline

ANUJA MANWARE

Xcaliber Infotech
Pune,Maharashtra
3
Languages
1
Certification
5
years of post-secondary education
5
years of professional experience

Results-driven Senior Data Engineer with over 4 years of proven expertise in architecting high-throughput data processing systems, robust ETL/ELT pipelines, and distributed cloud architectures. Specialized in Python, SQL, Apache Kafka, PySpark, and Azure Data Lake Storage (ADLS) paired with Amazon S3. Track record of cutting end-to-end data latency by 75%, scaling relational pipelines across 14 tables processing over 10M records per OEM, and engineering high-availability analytics infrastructures.

Work History

Senior Data Engineer

5 Years 3 Months
Xcaliber Infotech | Pune | 07.2021 - Current
  • End-to-End Pipeline Engineering: Architected and optimized distributed cloud ETL pipelines utilizing Python, SQL, and ADLS, reducing batch data latency by 75% while boosting ingestion throughput.
  • Real-Time Stream Processing: Deployed an Apache Kafka pub/sub messaging infrastructure for enterprise-scale streaming, enabling low-latency downstream data consumer feeds and live operational reporting.
  • Cloud Storage & Governance: Implemented dual-tier cloud storage architectures across Azure Data Lake Storage (ADLS) and Amazon S3, ensuring strict compliance with regulatory standards and enterprise data governance frameworks.
  • Automated API Ingestion: Built multi-format parsing pipelines handling semi-structured files (CSV, XML, XLSX, DAT), integrating Windows Graph API to automate mailbox attachment retrieval and raw data staging.
  • Data Cleansing & Quality: Created rigorous automated data validation, profiling, and sanitization routines to detect schema anomalies, guaranteeing 99.8% data integrity across analytical warehouses.
  • Business Intelligence Delivery: Designed executive Tableau dashboards integrated directly with analytical SQL data layers, transforming complex multi-source metrics into clear strategic KPIs.
  • Technical Standards: Standardized full-lifecycle data engineering documentation, workflow schematics, and runbooks, accelerating developer onboarding and auditing compliance.
  • Technologies: Python, SQL, Apache Kafka, Azure ADLS, Amazon S3, Tableau, MySQL, Pandas, NumPy, Windows Graph API

Senior Data Engineer

Shopfloor AT&T USA Ecosystem | undefinedundefined
  • Partner Data Onboarding: Engineered scalable generic onboarding data pipelines for Tier-1 OEM partners (Humax, Airties, Nokia, Gemtek, Comscope), reducing overall ingestion turnaround time by 70%.
  • Automated Pipeline Orchestration: Developed automated multi-stage ETL workflows executing parallel extraction, conversion to CSV, staging in ADLS, loading to relational SQL tables, and archival into Amazon S3.
  • High-Volume Transaction Processing: Scaled data pipelines across 14 tables processing approximately 10 million transaction records per table per OEM without pipeline stalls.
  • Automated Quality Alerts: Constructed an automated exception-handling framework integrated with SMTP alerting APIs to instantly flag format variances and data anomalies to external OEM partners.
  • Production Deployment
  • Tech Stack: Python, SQL, Azure ADLS, Amazon S3, SMTP / Email Notification APIs

Data Engineer

Broadband Analytics (AT&T Business Solutions) | undefinedundefined
  • Statistical Computing Pipeline: Built high-performance parametric data calculation pipelines using Pandas and SQLAlchemy to ingest high-frequency shopfloor manufacturing telemetry.
  • Statistical Quality Controls: Programmed statistical metrics and distribution hypothesis test suites including Process Capability Indices (Cp, Cpk), Upper/Lower Control Limits (UCL/LCL), Variance, Kolmogorov-Smirnov, Shapiro-Wilk, and Anderson-Darling tests.
  • Production Analytics
  • Tech Stack: Python, Pandas, NumPy, SciPy, SQLAlchemy, pyodbc, Requests

SQL Developer

Mobility Enterprise Data Warehouse | undefinedundefined
  • Query & Procedure Tuning: Engineered high-efficiency T-SQL stored procedures, user-defined functions, triggers, and views, achieving a 50% reduction in query runtimes and 25% lower response latency.
  • Dimensional Architecture: Built star-schema warehouse architectures with Fact tables, Dimension tables, and Slowly Changing Dimensions (SCD) via SSIS ETL, increasing analytical query performance by 40%.
  • Index Strategy: Conducted execution plan analysis, index defragmentation, and query restructuring, yielding a 15% increase in overall database transactional throughput.
  • Database Optimization
  • Tech Stack: MS SQL Server, T-SQL, SSIS ETL, Dimensional Modeling, Oracle, Flat Files

Education

Post Graduate Diploma - Big Data Analytics (PG-DBDA)

Institute For Advanced Computing And Software Development | Pune, India | 2020.09 - 2021.02

GPA: 85%

Bachelor of Technology (B.Tech) - Information Technology

Government College of Engineering | Amravati, India | 03.2015 - 05.2019

GPA: 8.49 / 10

Skills

Programming & Scripting: Python
SQL
T-SQL
PySpark
Linux Shell Scripting
Bash
Big Data & Streaming: Apache Kafka
PySpark
Hadoop (Hive
Pig)
Distributed Stream Processing
Cloud & Storage: Azure Data Lake Storage (ADLS Gen2)
Amazon S3
AWS (EC2)
Cloud Storage Archiving
Databases & Warehousing: MySQL
MS SQL Server
NoSQL (HBase
MongoDB)
Star Schema
SCD
Dimensional Modeling
Data Engineering & ETL: ETL/ELT Architecture
Data Validation Frameworks
Index Optimization
Windows Graph API
Libraries & Analytics: Pandas
NumPy
SciPy
SQLAlchemy
pyodbc
Requests
BeautifulSoup
Pandas Profiling
BI & Visualization: Tableau Desktop & Server
Business Intelligence Dashboards
Plotly
Matplotlib
Cloud data engineering
Streaming data pipelines
Dimensional modeling
Data governance

Certification

Databricks for Data Engineers – Scalable Apache Spark Data Processing & Lakehouse Foundations, Advanced Tableau for Business Intelligence & Data Analysis – Complex Visualizations, LOD Calculations, Dashboards, Supply Chain Fundamentals: Logistics & Transportation – Domain Expertise in Enterprise Supply Chain Data

Languages

Marathi
First Language
English
C2
Proficient
Hindi
C2
Proficient

Timeline

Senior Data Engineer

Xcaliber Infotech
07.2021 - CurrentRead More

Institute For Advanced Computing And Software Development

Post Graduate Diploma from Big Data Analytics (PG-DBDA)
2020.09 - 2021.02Read More

Government College of Engineering

Bachelor of Technology (B.Tech) from Information Technology
03.2015 - 05.2019Read More

SQL Developer

Mobility Enterprise Data Warehouse
Read More

Data Engineer

Broadband Analytics (AT&T Business Solutions)
Read More

Senior Data Engineer

Shopfloor AT&T USA Ecosystem
Read More
ANUJA MANWARE