原本命令為
bash tools/dist_train_copy.sh configs/body_2d_keypoint/rtmo/body7/rtmo-l_16xb16-600e_body7-640x640.py 1 --work-dir rtmo-l-7body-work-dir --amp
dist_train_copy.sh文件内容
CONFIG=$1
GPUS=$2
NNODES=${NNODES:-1}
NODE_RANK=${NODE_RANK:-0}
PORT=${PORT:-29500}
MASTER_ADDR=${MASTER_ADDR:-"127.0.0.1"}
PYTHONPATH="$(dirname $0)/..":$PYTHONPATH \
CUDA_VISIBLE_DEVICES=3 python -m torch.distributed.launch \
--nnodes=$NNODES \
--node_rank=$NODE_RANK \
--master_addr=$MASTER_ADDR \
--nproc_per_node=$GPUS \
--master_port=$PORT \
$(dirname "$0")/train.py \
$CONFIG \
--launcher pytorch ${@:3}
轉換后的launch.json文件内容
{
"version": "0.2.0",
"configurations": [
{
"name": "Debug RTMO Training",
"type": "debugpy",
"request": "launch",
"program": "${workspaceFolder}/data/mmpose-main/tools/train.py", // 路徑配置為你的訓練腳本
"args": [
"configs/body_2d_keypoint/rtmo/body7/rtmo-l_16xb16-600e_body7-640x640.py", // 配置文件路徑
"--work-dir", "rtmo-l-7body-work-dir", // 工作目錄
"--amp", // 可選的AMP標誌
"--launcher", "pytorch" // 指定使用的分佈式啟動器
],
"env": {
"PYTHONPATH": "${workspaceFolder}/data/mmpose-main", // 設置 Python 路徑
"CUDA_VISIBLE_DEVICES": "0", // 設置使用的 GPU
"NNODES": "1", // 節點數量
"NODE_RANK": "0", // 節點排序(對於單機使用 0)
"PORT": "29500", // 分佈式訓練端口
"MASTER_ADDR": "127.0.0.1", // 主節點地址
"RANK": "0", // 當前進程的 RANK
"WORLD_SIZE": "1", // 訓練進程總數
"MASTER_PORT": "29500" // 設置 MASTER_PORT
},
"console": "integratedTerminal", // 使用集成終端輸出
"cwd": "${workspaceFolder}/data/mmpose-main", // 設置工作目錄
"justMyCode": false // 調試外部庫
}
]
}