인프라

인프라

Kubernetes·Docker·클라우드·DB 운영에서 발생하는 장애와 성능 문제를 다룹니다. 임시 조치와 영구 해결을 구분해 안내합니다.

이런 분을 위한 섹션 · 컨테이너·클라우드 환경을 운영하는 DevOps·SRE·백엔드 엔지니어
읽는 순서 · 장애 상황이라면 많이 읽은 글의 진단 절차부터, 학습 목적이라면 시리즈를 순서대로 읽는 것을 추천합니다.
많이 읽은 글
No space left on device 30초 판정 런북 — df에 용량 남았는데 안 될 때
인프라7월 19일9

No space left on device 30초 판정 런북 — df에 용량 남았는데 안 될 때

ENOSPC(errno 28)로 서비스가 멈췄는데 df엔 용량이 남았다면? df·inode·삭제된 열린 파일·Docker까지 5개 명령으로 원인을 30초에 특정하고 원인별 복붙 복구·재발 방지까지 담은 실전 런북.

PostgreSQL too many clients already 30초 판정 복구 런북
인프라7월 13일7

PostgreSQL too many clients already 30초 판정 복구 런북

PostgreSQL 'FATAL: sorry, too many clients already' 에러를 30초 판정표로 원인(스파이크·누수·설정)부터 가르고, 복붙 SQL로 idle in transaction 종료·max_connections 튜닝·pgbouncer 도입까지 즉시 복구합니다.

ERROR 1040 Too many connections 해결: MySQL 커넥션 고갈 진단·복구 런북
인프라7월 12일7

ERROR 1040 Too many connections 해결: MySQL 커넥션 고갈 진단·복구 런북

MySQL ERROR 1040 Too many connections를 30초 만에 진단하고 즉시 복구하는 런북. SHOW PROCESSLIST·kill부터 max_connections·wait_timeout, HikariCP·Django·Laravel 풀 설정까지 복붙 가이드.

Docker 'port is already allocated' 30초 진단·복구 런북
인프라7월 10일6

Docker 'port is already allocated' 30초 진단·복구 런북

Docker의 'Bind for 0.0.0.0:XXXX failed: port is already allocated' 에러를 30초 만에 진단하고 복붙 명령으로 복구하는 실전 런북. 좀비 docker-proxy와 잔존 컨테이너 포트 점유를 정확히 해결합니다.

systemd Restart=always·on-failure 예제와 무한재시작 방지법
인프라7월 10일6

systemd Restart=always·on-failure 예제와 무한재시작 방지법

systemd 자동재시작을 복붙 가능한 .service 예제로 완성합니다. Restart=always와 on-failure 차이, StartLimitBurst로 무한 재시작 루프 막기, daemon-reload·enable·journalctl 검증 명령과 FAQ까지 정리했습니다.

Too many open files(EMFILE errno 24) 30초 진단·복구 런북
인프라7월 9일7

Too many open files(EMFILE errno 24) 30초 진단·복구 런북

리눅스·Nginx·Node·Java의 'Too many open files'(EMFILE, errno 24)를 30초에 진단하는 매칭표와 계층별 복붙 복구 명령. ulimit -n, systemd LimitNOFILE, worker_rlimit_nofile, FD 누수 판별까지 정리했습니다.

apt Could not get lock /var/lib/dpkg/lock-frontend 30초 진단·복구 런북
인프라7월 6일4

apt Could not get lock /var/lib/dpkg/lock-frontend 30초 진단·복구 런북

'Could not get lock /var/lib/dpkg/lock-frontend' 에러를 30초 진단표로 원인(중복 apt·unattended-upgrades·cloud-init·stale lock)까지 판별. lock 파일 rm 여부와 복붙 복구 3안, 재발 방지까지 온콜 런북으로 정리했습니다.

kubectl localhost:8080 refused 에러 30초 진단·복구 런북
인프라7월 5일5

kubectl localhost:8080 refused 에러 30초 진단·복구 런북

kubectl 'connection to localhost:8080 was refused' 에러를 30초 진단표와 복붙 명령으로 해결합니다. kubeconfig 경로·KUBECONFIG·context·sudo 함정·EKS/GKE 위치까지 원인 5계열 정리.

kubectl Unauthorized 원인별 3분 진단·복구 런북 (EKS 재발급)
인프라7월 4일5

kubectl Unauthorized 원인별 3분 진단·복구 런북 (EKS 재발급)

kubectl 'You must be logged in to the server (Unauthorized)' 에러를 토큰·인증서 만료, context·RBAC·엔드포인트 5가지로 분기 진단하고, aws eks update-kubeconfig 재발급과 openssl 만료 확인까지 복붙으로 3분 내 복구하세요.

Redis MISCONF unable to persist on disk 에러 5분 복구 런북
인프라7월 3일5

Redis MISCONF unable to persist on disk 에러 5분 복구 런북

Redis가 'MISCONF unable to persist on disk'로 쓰기를 전부 거부할 때 쓰는 5분 복구 런북. 디스크 full·overcommit_memory·dir 권한 3대 원인을 진단 명령으로 특정하고 임시조치부터 영구 해결까지 복붙으로 끝냅니다.

K8s Liveness/Readiness probe failed·connection refused 원인별 해결
인프라6월 29일4

K8s Liveness/Readiness probe failed·connection refused 원인별 해결

kubectl Events에 찍힌 Liveness/Readiness probe failed, connection refused, context deadline exceeded 에러를 원문 그대로 매칭해 30초 만에 원인을 찾는 결정 트리와 복붙 YAML, 권장 임계치 정리.

Pod Pending FailedScheduling 0/3 nodes 30초 진단·복구 런북
인프라6월 28일4

Pod Pending FailedScheduling 0/3 nodes 30초 진단·복구 런북

Pod가 FailedScheduling 0/3 nodes(insufficient cpu/memory·taint·node selector)로 Pending에 멈췄나요? Events 한 줄로 원인을 분기하고 requests 축소·toleration·노드 증설을 결정 트리로 즉시 복구하는 실전 런북입니다.

OOMKilled exit code 137 해결: kubectl 30초 진단·5분 복구 런북
인프라6월 28일5

OOMKilled exit code 137 해결: kubectl 30초 진단·5분 복구 런북

Pod가 OOMKilled exit code 137로 죽었나요? kubectl describe·jsonpath·dmesg로 컨테이너 limit 초과인지 노드 메모리 압박인지 30초에 가르고, requests/limits 재산정·JVM 힙 설정·Guaranteed QoS·알람까지 복붙 명령으로 5분 복구합니다.

fork: retry: Resource temporarily unavailable 30초 진단 런북
인프라6월 27일5

fork: retry: Resource temporarily unavailable 30초 진단 런북

fork: retry, pthread_create failed, unable to create new native thread는 nproc 한도 고갈 아니면 메모리 부족입니다. ulimit·ps·free·dmesg로 30초 진단하고 limits.conf·TasksMax·cgroup pids.max로 영구 해결하는 복붙 런북.

connection refused / ECONNREFUSED 127.0.0.1 30초 진단 런북
인프라6월 27일5

connection refused / ECONNREFUSED 127.0.0.1 30초 진단 런북

'connection refused'·'ECONNREFUSED 127.0.0.1' 에러를 30초에 분기하는 4단계 런북. 서버 미기동·포트 불일치·방화벽·바인드 주소(127.0.0.1 vs 0.0.0.0)를 복붙 명령으로 진단하고 curl·Node·Go·psql 케이스까지 정리했습니다.

address already in use 해결: 포트 점유 프로세스 찾아 종료하기 (EADDRINUSE)
인프라6월 26일4

address already in use 해결: 포트 점유 프로세스 찾아 종료하기 (EADDRINUSE)

bind: address already in use·EADDRINUSE 에러로 막막할 때, lsof·netstat로 포트 점유 프로세스를 찾아 안전히 종료하고 TIME_WAIT·중복 기동까지 막는 OS별 복붙 명령어를 단계별로 정리했습니다.

CrashLoopBackOff 해결: kubectl로 Pod 재시작 무한루프 5분 진단
인프라6월 25일6

CrashLoopBackOff 해결: kubectl로 Pod 재시작 무한루프 5분 진단

Pod가 CrashLoopBackOff로 무한 재시작될 때 kubectl describe와 logs --previous로 5분 안에 원인 찾기. Exit Code 1/2/126/137 진단표와 command·probe·ConfigMap 원인별 복붙 처방 YAML 정리.

ImagePullBackOff·ErrImagePull 해결: Events로 원인 진단하고 복붙으로 끝내기
인프라6월 23일6

ImagePullBackOff·ErrImagePull 해결: Events로 원인 진단하고 복붙으로 끝내기

kubectl ImagePullBackOff와 ErrImagePull을 Events 메시지 진단표로 5분 만에 특정합니다. imagePullSecrets 네임스페이스, private registry 인증, Docker Hub rate limit, ECR 토큰 만료까지 복붙 명령어로 해결하는 실전 가이드.

nginx 502 Bad Gateway 원인 진단표·복붙 명령어로 5분 해결
인프라6월 23일5

nginx 502 Bad Gateway 원인 진단표·복붙 명령어로 5분 해결

nginx 502 Bad Gateway, 무작정 재시작 마세요. 원인별 진단표와 error.log 키워드 매칭, php-fpm·gunicorn·uvicorn 업스트림별 복붙 명령어로 원인을 특정하고 SELinux·소켓 권한 함정까지 빠르게 해결합니다.

Docker permission denied /var/run/docker.sock 에러 5분 해결법
인프라6월 23일5

Docker permission denied /var/run/docker.sock 에러 5분 해결법

Docker permission denied /var/run/docker.sock 에러를 원인별 진단표와 복붙 명령어로 해결합니다. usermod 후에도 안 될 때 세션 재적용법과 CI·rootless·보안 주의점까지 한 번에 정리했습니다.

certbot renew 실패·NET::ERR_CERT_DATE_INVALID 30분 복구 가이드
인프라6월 23일5

certbot renew 실패·NET::ERR_CERT_DATE_INVALID 30분 복구 가이드

certbot renew 실패와 NET::ERR_CERT_DATE_INVALID로 사이트가 멈췄나요? 80포트 차단·webroot 404·rate limit 등 증상별 진단표와 nginx/apache 복구 명령, systemd·cron 자동갱신까지 복붙으로 해결합니다.

SSH Permission denied (publickey) 원인·해결 5분 진단 (EC2)
인프라6월 23일5

SSH Permission denied (publickey) 원인·해결 5분 진단 (EC2)

SSH Permission denied (publickey) 에러를 ssh -vvv 로그로 클라이언트·서버 분기 진단합니다. 키 권한, authorized_keys, sshd_config, EC2 사용자명까지 단계별 명령어로 5분 안에 복구하세요.

Istio/Ingress 네트워킹 장애, YAML로 근본 원인 디버깅하는 완벽 가이드
인프라6월 21일5

Istio/Ingress 네트워킹 장애, YAML로 근본 원인 디버깅하는 완벽 가이드

마이크로서비스 환경에서 Istio와 Ingress 사용 중 발생하는 트래픽 라우팅 오류, Path Matching 실패 등 복잡한 네트워킹 문제를 해결하는 실전 가이드입니다. 필수 YAML 예시와 L4/L7 디버깅 체크리스트를 통해 운영 안정성을 확보하세요.

쿠버네티스 NetworkPolicy: Zero Trust 기반 서비스 통신 제어 실습 가이드
인프라6월 21일5

쿠버네티스 NetworkPolicy: Zero Trust 기반 서비스 통신 제어 실습 가이드

MSA 환경의 보안 취약점을 근본적으로 차단하는 쿠버네티스 NetworkPolicy 완벽 가이드입니다. 기본 원리부터 Ingress/Egress YAML 구현, 그리고 최소 권한 원칙을 적용한 Default Deny 전략까지 실습 위주로 상세히 다룹니다.