# encrypted-traffic-classification **Repository Path**: ai_-agent/encrypted-traffic-classification ## Basic Information - **Project Name**: encrypted-traffic-classification - **Description**: encrypted traffic classification with deep learning - **Primary Language**: Unknown - **License**: MIT - **Default Branch**: main - **Homepage**: None - **GVP Project**: No ## Statistics - **Stars**: 0 - **Forks**: 0 - **Created**: 2026-07-30 - **Last Updated**: 2026-08-02 ## Categories & Tags **Categories**: Uncategorized **Tags**: None ## README # 基于深度学习的加密网络流量分类研究 本仓库对应论文的真实数据实验。主任务基于官方 ISCX VPN-nonVPN 2016 原始 PCAP,采用源感知划分、类别不平衡处理、生成质量审计和模型消融。早期模拟数据结果不作为论文证据。 ## 当前实验任务 - 数据源:ISCX VPN-nonVPN 2016 官方 PCAP。 - 输入:每个双向会话前 8 个数据包、每包前 128 字节。 - 隐私与防泄漏处理:屏蔽 IP 地址、端口和校验和。 - 类别:11 类服务。官方发布文件中未发现非 VPN P2P 抓包,因此排除该类;Browsing 与 VPN-Browsing 不进入主任务。 - 会话数:18,495。 - 划分:训练集 14,676,验证集 1,898,测试集 1,921。 - 主指标:Macro-F1,同时报告 Accuracy 和 Weighted-F1。 ## 目录 ```text configs/ 实验配置 data/ 预处理、划分和增强脚本 models/ ABCNet、Attention-BiLSTM、1D-CNN、CGAN train/ 模型训练入口 evaluate/ 评估、统计检验、效率测试和绘图 scripts/ 可复现实验的 PowerShell 流程 artifacts/manifests/ 数据摘要、捕获清单和划分审计 artifacts/runs/ 训练日志、指标、预测及检查点 artifacts/results/ 汇总结果 artifacts/figures/ 论文图表源文件 docs/ 实验协议与复现说明 ``` 原始 PCAP、处理中间 NPZ 和模型检查点体积较大,不应直接放入论文提交压缩包。 ## 环境 - Windows 11 / PowerShell - Python 3.12.13 - PyTorch 2.5.1+cu121 - NVIDIA GeForce GTX 1650 4 GB 安装依赖: ```powershell python -m venv .venv .\.venv\Scripts\Activate.ps1 pip install -r requirements.txt ``` ## 数据准备 将官方数据集放在: ```text ISCX-VPN-NonVPN-2016/ ``` 若使用自动下载脚本,请先通过参数或以下环境变量提供你本人接受数据许可时使用的注册信息;不要把真实值写入仓库:`CIC_FIRST_NAME`、`CIC_LAST_NAME`、`CIC_EMAIL`、`CIC_INSTITUTION`、`CIC_JOB_TITLE`、`CIC_COUNTRY`。 依次执行: ```powershell .\scripts\prepare_iscxvpn2016.ps1 .\.venv\Scripts\python.exe data\build_manifest.py .\.venv\Scripts\python.exe data\preprocess_sessions.py .\.venv\Scripts\python.exe data\create_splits.py ``` 实际参数、输出路径和划分例外见 `docs/EXPERIMENT_PROTOCOL.md` 与 `configs/config.yaml`。 ## 主要实验 ```powershell # 未增强与 SMOTE 多随机种子实验 .\scripts\run_baseline_smote_multiseed.ps1 # seed=42 消融实验 .\scripts\run_ablation_seed42.ps1 # Attention-BiLSTM 其余随机种子 .\scripts\run_temporal_multiseed.ps1 # 汇总、统计、效率和论文图表 .\.venv\Scripts\python.exe evaluate\summarize_runs.py .\.venv\Scripts\python.exe evaluate\statistical_analysis.py .\.venv\Scripts\python.exe evaluate\temporal_vs_full_statistics.py .\.venv\Scripts\python.exe evaluate\benchmark_models.py .\.venv\Scripts\python.exe evaluate\generate_publication_figures.py ``` ## 论文采用的主要结果 | 实验 | Accuracy | Macro-F1 | Weighted-F1 | |---|---:|---:|---:| | 未增强,seed=42 | 0.3654 | 0.2612 | 0.3269 | | 随机过采样,seed=42 | 0.2166 | 0.2463 | 0.1762 | | CGAN,seed=42 | 0.3618 | 0.2682 | 0.3244 | | SMOTE,seed=42 | 0.3498 | 0.3737 | 0.3391 | 五随机种子结果: - 未增强 Macro-F1:0.2580±0.0143。 - SMOTE Macro-F1:0.3400±0.0253,五次均改善,平均提升 0.0820。 - Attention-BiLSTM Macro-F1:0.3653±0.0210。 - 拼接式 ABCNet Macro-F1:0.3400±0.0253。 CGAN 真实/生成样本检测 AUC 为 0.95–1.00,表明当前生成分布仍存在明显偏移,因此论文不宣称 CGAN 优于 SMOTE。 ## 证据定位 - 数据与划分:`artifacts/manifests/` - 单次运行:`artifacts/runs//` - 汇总结果:`artifacts/results/` - 论文图表:`artifacts/figures/` - 实验协议:`docs/EXPERIMENT_PROTOCOL.md`