خطاهای Job و Slurm¶
این صفحه برای زمانی است که Job شما در صف میماند، سریع Fail میشود، خروجی نمیدهد یا با خطاهایی مثل TIMEOUT و OUT_OF_MEMORY تمام میشود.
وضعیت Jobهای خودتان¶
سابقه Jobهای امروز¶
بررسی یک Job خاص¶
جزئیات بیشتر:
Job در حالت PENDING مانده است¶
اگر Job شما Pending است:
دلایل رایج:
| دلیل | معنی | راهکار |
|---|---|---|
Resources | منابع آزاد کافی نیست | صبر کنید یا منابع کمتری درخواست کنید |
Priority | Jobهای دیگر اولویت بالاتری دارند | صبر کنید |
PartitionTimeLimit | زمان انتخابی با صف سازگار نیست | زمان یا Partition را اصلاح کنید |
ReqNodeNotAvail | نود موردنیاز در دسترس نیست | درخواست نود خاص را حذف کنید |
Job سریع Fail میشود¶
اگر Job بلافاصله Fail شد، معمولاً یکی از این موارد علت است:
| علت | بررسی |
|---|---|
| مسیر اشتباه | pwd و خط cd در فایل Slurm |
| فایل ورودی وجود ندارد | ls -lah |
| دستور پیدا نمیشود | which COMMAND |
| کتابخانه Python نصب نیست | بررسی venv |
| Permission مشکل دارد | ls -lah |
فایل .err خطا دارد | cat logs/*.err |
خطای TIMEOUT¶
یعنی زمان Job تمام شده است.
راهکار:
- با داده کوچکتر تست کنید.
- زمان را منطقی افزایش دهید.
- اگر کد گیر کرده، قبل از افزایش زمان مشکل کد را حل کنید.
خطای OUT_OF_MEMORY¶
یعنی حافظه درخواستشده کافی نبوده است.
راهکار:
- مصرف RAM را کاهش دهید.
- داده را مرحلهای پردازش کنید.
- حافظه را با مقدار منطقی افزایش دهید.
- برای کارهای خیلی پرحافظه، Partition مناسب را انتخاب کنید.
خطای command not found¶
اگر از Python venv استفاده میکنید:
خطای ModuleNotFoundError¶
فایلهای خروجی را پیدا نمیکنم¶
اگر در فایل Slurm چنین خطهایی دارید:
پس خروجیها در پوشه logs هستند:
قبل از ارسال Job بزرگ
همیشه ابتدا با زمان کم، داده کوچک و منابع کم تست کنید. بعد از اطمینان، Job اصلی را ارسال کنید.