Research questionWhen should soft-arm controllers use centralized versus distributed reinforcement learning under increasing complexity, disturbances, and actuator failures?A single global policy and distributed agent policies may differ in scalability, training efficiency, and recovery when a soft arm becomes more complex or its operation is disrupted. The relevant choice can change between ordinary target reaching, disturbance recovery, and actuator-failure adaptation.