Skip to content

AWS Data Analytics Specialty (DAS-C01) - Fact Sheet

⚠️ RETIRED April 8, 2024. No longer available for new candidates. Replaced by AWS Data Engineer - Associate (DEA-C01). Material preserved as historical reference.

Quick Reference

Exam Code: DAS-C01 Duration: 180 minutes Questions: 65 questions Passing Score: 750/1000 Cost: $300 USD Validity: 3 years Difficulty: ⭐⭐⭐⭐⭐

Exam Domains

Domain Weight Key Focus
Collection 18% Kinesis, IoT, DMS, data ingestion
Storage & Data Management 22% S3, Lake Formation, data lakes
Processing 24% Lambda, Glue, EMR, batch/stream processing
Analysis & Visualization 18% Athena, Redshift, QuickSight
Security 18% Encryption, IAM, data governance

Data Collection Services

Amazon Kinesis

Kinesis Data Streams - Real-time data streaming - Shard-based architecture: 1 MB/sec or 1,000 records/sec write, 2 MB/sec read per shard - Retention: 24 hours (default) to 365 days - Consumers: Kinesis Client Library (KCL), Lambda, Kinesis Data Analytics - πŸ“– Kinesis Data Streams Concepts - Shards, records, producers, consumers - πŸ“– Shard Management - Splitting and merging shards - πŸ“– Kinesis Producers - SDK, KPL, Kinesis Agent

Kinesis Data Firehose - Load streaming data to destinations - Near real-time (60 sec minimum buffer) - Destinations: S3, Redshift, OpenSearch, HTTP endpoints, Datadog, Splunk - Transformation: Lambda functions for data transformation - Compression: GZIP, ZIP, Snappy for S3 - No shard management (fully managed) - πŸ“– Firehose Concepts - Delivery streams, buffering - πŸ“– Data Transformation - Lambda integration - πŸ“– Delivery to S3 - Partitioning, compression

Kinesis Data Analytics - Real-time analytics on streaming data - SQL or Apache Flink for processing - Sources: Kinesis Data Streams, Firehose - Sinks: Kinesis Data Streams, Firehose, Lambda - πŸ“– Kinesis Analytics SQL - Streaming SQL concepts - πŸ“– Apache Flink Applications - Java/Scala applications

AWS Glue

Glue Data Catalog - Centralized metadata repository - Stores table definitions, schema, location - Integrated with Athena, Redshift Spectrum, EMR - Crawlers: Automatic schema discovery from S3, JDBC, DynamoDB - πŸ“– Glue Data Catalog - Databases, tables, connections - πŸ“– Crawlers - Automatic schema detection - πŸ“– Partitions - Partition pruning for performance

Glue ETL - Serverless ETL service - PySpark or Scala for transformations - Dynamic frames: Extension of Spark DataFrames - Job bookmarks: Track processed data to avoid reprocessing - Development endpoints for testing - πŸ“– Glue ETL Concepts - Jobs, triggers, workflows - πŸ“– DynamicFrames - Schema flexibility - πŸ“– Job Bookmarks - Incremental processing - πŸ“– Glue Studio - Visual ETL designer

Glue DataBrew - Visual data preparation - 250+ built-in transformations - Profile data quality - No code data cleaning - πŸ“– DataBrew Concepts - Datasets, recipes, jobs

Other Collection Services

AWS Database Migration Service (DMS) - Continuous replication for data pipelines - CDC (Change Data Capture) for real-time updates - Supports 20+ source and target databases - πŸ“– DMS for Analytics - Streaming data to S3, Kinesis - πŸ“– DMS CDC - Change data capture - πŸ“– DMS Targets - S3, Kinesis, Redshift

AWS IoT Core - Device connectivity and message broker - Rules engine to route messages to Kinesis, Lambda, S3 - πŸ“– IoT Core Rules - SQL-based message routing - πŸ“– IoT Core Analytics - IoT data processing - πŸ“– Device Shadows - Device state

Amazon MSK - Managed Apache Kafka - Fully managed Kafka clusters - MSK Connect for Kafka Connect connectors - MSK Serverless for automatic scaling - πŸ“– MSK Documentation - Brokers, topics, partitions - πŸ“– MSK Connect - Kafka connectors - πŸ“– MSK Serverless - Auto-scaling Kafka

Storage & Data Management

Amazon S3

S3 for Data Lakes - Standard storage class for hot data - Intelligent-Tiering for cost optimization - Glacier for archival - Versioning for data protection - πŸ“– S3 for Data Lakes - Data lake architecture - πŸ“– S3 Storage Classes - Performance and cost trade-offs - πŸ“– S3 Lifecycle - Transition rules - πŸ“– S3 Inventory - Audit and report

S3 Partitioning - Organize data by date, region, type for query performance - Hive-style partitions: s3://bucket/year=2023/month=10/day=12/ - Partition projection in Athena for dynamic partitions - πŸ“– S3 Key Design - Request performance - πŸ“– Partition Projection - Query optimization

S3 Replication - Cross-Region Replication (CRR) for DR - Same-Region Replication (SRR) for compliance - πŸ“– S3 Replication - Configuration and use cases - πŸ“– Replication Time Control - Predictable replication

AWS Lake Formation

Centralized Data Lake Management - Fine-grained access control (column/row/cell-level) - Blueprints for data ingestion - Data catalog integration - Governed tables for ACID transactions - πŸ“– Lake Formation Concepts - Data lakes, permissions - πŸ“– Security - Tag-based access control (TBAC) - πŸ“– Governed Tables - ACID transactions on S3 - πŸ“– Blueprints - Automated data ingestion - πŸ“– Data Filters - Row and cell-level security

Processing Services

AWS Lambda

Event-Driven Processing - Trigger from S3, Kinesis, DynamoDB Streams, SQS - 15-minute max execution time - 10 GB memory max - πŸ“– Lambda Event Sources - Stream processing - πŸ“– Lambda Layers - Shared libraries - πŸ“– Lambda Concurrency - Reserved and provisioned

Amazon EMR

Managed Hadoop/Spark Clusters - Frameworks: Hadoop, Spark, Hive, Presto, HBase, Flink - Cluster types: Transient (terminate after job) or long-running - Instance types: Master, Core (HDFS), Task (compute only) - πŸ“– EMR Overview - Architecture - πŸ“– EMR on EKS - Run on Kubernetes - πŸ“– EMR Serverless - No cluster management - πŸ“– Spot Instances - Cost optimization

EMR File Systems - EMRFS: Direct S3 access with consistent view - HDFS: Local storage on cluster - πŸ“– EMRFS - S3 integration - πŸ“– HDFS Configuration - HDFS on EMR

AWS Batch

Managed Batch Processing - Docker containers for batch jobs - Job queues and compute environments - Job dependencies and scheduling - πŸ“– Batch Concepts - Jobs, queues, compute environments - πŸ“– Job Definitions - Container properties - πŸ“– Array Jobs - Parallel processing

AWS Step Functions

Workflow Orchestration - Coordinate Lambda, Batch, EMR, Glue, SageMaker - Standard (up to 1 year) or Express (up to 5 minutes) workflows - Error handling with retry and catch - πŸ“– Step Functions for Data Pipelines - Workflow types - πŸ“– Service Integrations - AWS service integration - πŸ“– Error Handling - Retry and catch patterns

Analysis & Visualization

Amazon Athena

Serverless SQL Queries on S3 - Presto-based SQL engine - Pay per query ($ 5 per TB scanned) - File formats: Parquet, ORC, JSON, CSV, Avro - Partitioning for cost/performance optimization - Federated queries to RDS, DynamoDB, Redshift - πŸ“– Athena Concepts - Databases, tables, queries - πŸ“– Performance Tuning - Partitioning, compression, columnar formats - πŸ“– Workgroups - Query isolation and cost control - πŸ“– Federated Query - Query across data sources

Optimization - Use Parquet/ORC for 10x+ performance vs CSV - Compress data (GZIP, Snappy) - Partition by frequently filtered columns - Use columnar formats for selective column reads - πŸ“– Columnar Formats - Parquet vs ORC - πŸ“– Compression Support - Supported formats - πŸ“– Query Optimization - Best practices

Amazon Redshift

Petabyte-Scale Data Warehouse - Columnar storage, MPP architecture - Node types: RA3 (managed storage), DC2 (compute-dense), DS2 (storage-dense) - Distribution styles: KEY, EVEN, ALL, AUTO - Sort keys: Compound, interleaved - πŸ“– Redshift Architecture - Leader and compute nodes - πŸ“– Distribution Styles - KEY, EVEN, ALL - πŸ“– Sort Keys - Compound vs interleaved - πŸ“– Compression Encoding - Column compression

Redshift Spectrum - Query S3 directly from Redshift - External tables in Glue Data Catalog - Query S3 data without loading - Scalable compute separate from Redshift cluster - πŸ“– Redshift Spectrum - External tables - πŸ“– Spectrum Best Practices - Performance optimization

Concurrency Scaling - Automatic scaling for burst query traffic - Up to 10 clusters (default) - First hour free per day - πŸ“– Concurrency Scaling - Automatic capacity - πŸ“– WLM Configuration - Workload management

Materialized Views - Pre-computed query results - Auto-refresh or manual refresh - Improves query performance - πŸ“– Materialized Views - Creation and management - πŸ“– Auto Refresh - Automatic refresh

Amazon QuickSight

Business Intelligence & Visualization - SPICE: In-memory calculation engine - Data sources: S3, Athena, Redshift, RDS, SaaS - ML Insights: Anomaly detection, forecasting, auto-narratives - Embedding: Dashboards in applications - πŸ“– QuickSight Concepts - Datasets, analyses, dashboards - πŸ“– SPICE - In-memory engine - πŸ“– ML Insights - Anomaly detection - πŸ“– Embedding Dashboards - Embed in applications - πŸ“– Q for QuickSight - Natural language queries

Amazon OpenSearch Service

Search and Analytics Engine - Formerly Elasticsearch Service - Log analytics, full-text search, application monitoring - Kibana dashboards - πŸ“– OpenSearch Documentation - Domains, indices, shards - πŸ“– Index Management - Index lifecycle - πŸ“– Performance Tuning - Optimization

Security for Analytics

Encryption

At Rest - S3: SSE-S3, SSE-KMS, SSE-C - Redshift: KMS encryption for cluster and snapshots - Kinesis: KMS encryption for data streams - Glue Data Catalog: KMS encryption - πŸ“– S3 Encryption - Server-side encryption options - πŸ“– KMS Key Policies - Grant access to services

In Transit - TLS/SSL for all data transfers - VPC endpoints for private connectivity - πŸ“– VPC Endpoints - S3, DynamoDB, Kinesis

Access Control

IAM Policies - Service-level access control - Bucket policies for S3 - πŸ“– S3 Bucket Policies - Examples

Lake Formation Permissions - Fine-grained access control (column/row/cell) - Tag-based access control (TBAC) - Data filters for row-level security - πŸ“– Lake Formation Security - Permissions model

Redshift Security - VPC for network isolation - IAM roles for COPY/UNLOAD to S3 - Database users and groups - πŸ“– Redshift Security - IAM and database users

Common Analytics Architectures

Lambda Architecture

Batch Layer: S3 β†’ Glue/EMR β†’ Redshift (historical, accurate)
Speed Layer: Kinesis β†’ Lambda/Kinesis Analytics β†’ DynamoDB (real-time, approximate)
Serving Layer: Athena/Redshift/QuickSight (query both layers)
πŸ“– Lambda Architecture - Batch and speed layers

Modern Data Lake

Ingestion: Kinesis, DMS, IoT β†’ S3 (raw zone)
Processing: Glue ETL β†’ S3 (processed zone)
Catalog: Glue Data Catalog
Access Control: Lake Formation
Query: Athena, Redshift Spectrum
Visualization: QuickSight

Real-Time Analytics Pipeline

IoT devices β†’ IoT Core β†’ Kinesis Data Streams
  β†’ Kinesis Data Analytics (SQL/Flink)
  β†’ Kinesis Data Firehose β†’ S3/OpenSearch
  β†’ QuickSight (real-time dashboards)

Exam Tips

Service Selection Matrix: - Real-time streaming: Kinesis Data Streams - Near real-time load: Kinesis Data Firehose - Batch ETL: Glue, EMR - Ad-hoc SQL on S3: Athena - Data warehouse: Redshift - BI dashboards: QuickSight - Search/logs: OpenSearch - Graph data: Neptune

Performance Keywords: - "Cost-effective" β†’ Athena (pay per query), S3 Intelligent-Tiering, Spot for EMR - "Real-time" β†’ Kinesis Data Streams, Lambda - "Petabyte-scale" β†’ Redshift, EMR - "Serverless" β†’ Athena, Glue, Lambda, Firehose - "ML insights" β†’ QuickSight ML Insights, SageMaker


Pro Tip: This exam is all about choosing the RIGHT service for the use case. Understand data velocity (batch vs streaming), volume (GB vs PB), variety (structured vs unstructured), and cost constraints. Know when to use Glue vs EMR, Athena vs Redshift, Kinesis Streams vs Firehose!