drm/amdgpu: Handle the GPU recovery failure in SRIOV environment.

This patch handles the GPU recovery failure in sriov environment by retrying the reset if the first reset fails. To determine the condition of retry, a new macro AMDGPU_RETRY_SRIOV_RESET is added which returns true if failure is due to ETIMEDOUT, EINVAL or EBUSY, otherwise return false.A new macro AMDGPU_MAX_RETRY_LIMIT is used to limit the retry to 2. It also handles the return status in Post Asic Reset by updating the return code with asic_reset_res and eventually return the return code in amdgpu_job_timedout(). Signed-off-by: Surbhi Kakarya <surbhi.kakarya@amd.com> Reviewed-by: Andrey Grodzovsky <andrey.grodzovsky@amd.com> Signed-off-by: Alex Deucher <alexander.deucher@amd.com>
author: Surbhi Kakarya <surbhi.kakarya@amd.com> 2022-01-26 12:04:39 -0500
committer: Alex Deucher <alexander.deucher@amd.com> 2022-02-14 15:08:41 -0500
commit: 7258fa31eabd882f6c8ed4d6d281f6657a33ef94 (patch)
tree: 188ff6cc7c8b5593b99ec6fd5a470bd87857a788 /drivers/gpu/drm/amd/amdgpu/amdgpu_job.c
parent: 1ec1944eb50c8de2d96de1188eec9f8b22d03366 (diff)
1 files changed, 5 insertions, 1 deletions
diff --git a/drivers/gpu/drm/amd/amdgpu/amdgpu_job.c b/drivers/gpu/drm/amd/amdgpu/amdgpu_job.c
index bfc47bea23db..4870e093213d 100644
--- a/drivers/gpu/drm/amd/amdgpu/amdgpu_job.c
+++ b/drivers/gpu/drm/amd/amdgpu/amdgpu_job.c
@@ -37,6 +37,7 @@ static enum drm_gpu_sched_stat amdgpu_job_timedout(struct drm_sched_job *s_job)
 	struct amdgpu_task_info ti;
 	struct amdgpu_device *adev = ring->adev;
 	int idx;
+	int r;
 
 	if (!drm_dev_enter(adev_to_drm(adev), &idx)) {
 		DRM_INFO("%s - device unplugged skipping recovery on scheduler:%s",
@@ -63,7 +64,10 @@ static enum drm_gpu_sched_stat amdgpu_job_timedout(struct drm_sched_job *s_job)
 		  ti.process_name, ti.tgid, ti.task_name, ti.pid);
 
 	if (amdgpu_device_should_recover_gpu(ring->adev)) {
-		amdgpu_device_gpu_recover(ring->adev, job);
+		r = amdgpu_device_gpu_recover(ring->adev, job);
+		if (r)
+			DRM_ERROR("GPU Recovery Failed: %d\n", r);
+
 	} else {
 		drm_sched_suspend_timeout(&ring->sched);
 		if (amdgpu_sriov_vf(adev))
author	Surbhi Kakarya <surbhi.kakarya@amd.com>	2022-01-26 12:04:39 -0500
committer	Alex Deucher <alexander.deucher@amd.com>	2022-02-14 15:08:41 -0500
commit	7258fa31eabd882f6c8ed4d6d281f6657a33ef94 (patch)
tree	188ff6cc7c8b5593b99ec6fd5a470bd87857a788 /drivers/gpu/drm/amd/amdgpu/amdgpu_job.c
parent	1ec1944eb50c8de2d96de1188eec9f8b22d03366 (diff)