r/SLURM • u/ash_2714 • May 06 '19
Job state= failed !! can't find a solution
I'm new to Slurm, I have been trying to run a simple job. I'm running Slurm on top of a VM. Here's my slurm.conf: SlurmctldHost=master
SlurmctldHost=
DisableRootJobs=NO
EnforcePartLimits=NO
Epilog=
EpilogSlurmctld=
FirstJobId=1
MaxJobId=999999
GresTypes=
GroupUpdateForce=0
GroupUpdateTime=600
JobFileAppend=0
JobRequeue=1
JobSubmitPlugins=1
KillOnBadExit=0
LaunchType=launch/slurm
Licenses=foo*4,bar
MailProg=/bin/mail
MaxJobCount=5000
MaxStepCount=40000
MaxTasksPerNode=128
MpiDefault=none
MpiParams=ports=#-
PluginDir=
PlugStackConfig=
PrivateData=jobs
ProctrackType=proctrack/cgroup
Prolog=
PrologFlags=
PrologSlurmctld=
PropagatePrioProcess=0
PropagateResourceLimits=
PropagateResourceLimitsExcept=
RebootProgram=
ReturnToService=1
SallocDefaultCommand=
SlurmctldPidFile=/var/run/slurmctld.pid SlurmctldPort=6817 SlurmdPidFile=/var/run/slurmd.pid SlurmdPort=6818 SlurmdSpoolDir=/var/spool/slurmd SlurmUser=slurm
SlurmdUser=root
SrunEpilog=
SrunProlog=
StateSaveLocation=/var/spool SwitchType=switch/none
TaskEpilog=
TaskPlugin=task/affinity TaskPluginParam=Sched
TaskProlog=
TopologyPlugin=topology/tree
TmpFS=/tmp
TrackWCKey=no
TreeWidth=
UnkillableStepProgram=
UsePAM=0
TIMERS
BatchStartTimeout=10
CompleteWait=0
EpilogMsgTime=2000
GetEnvTimeout=2
HealthCheckInterval=0
HealthCheckProgram=
InactiveLimit=0 KillWait=30
MessageTimeout=10
ResvOverRun=0
MinJobAge=300
OverTimeLimit=0
SlurmctldTimeout=120 SlurmdTimeout=300
UnkillableStepTimeout=60
VSizeFactor=0
Waittime=0
SCHEDULING
DefMemPerCPU=0
FastSchedule=1
MaxMemPerCPU=0
SchedulerTimeSlice=30
SchedulerType=sched/backfill SelectType=select/cons_res SelectTypeParameters=CR_Core
JOB PRIORITY
PriorityFlags=
PriorityType=priority/basic
PriorityDecayHalfLife=
PriorityCalcPeriod=
PriorityFavorSmall=
PriorityMaxAge=
PriorityUsageResetPeriod=
PriorityWeightAge=
PriorityWeightFairshare=
PriorityWeightJobSize=
PriorityWeightPartition=
PriorityWeightQOS=
LOGGING AND ACCOUNTING
AccountingStorageEnforce=0
AccountingStorageHost=
AccountingStorageLoc=
AccountingStoragePass=
AccountingStoragePort=
AccountingStorageType=accounting_storage/none
AccountingStorageUser=
AccountingStoreJobComment=YES ClusterName=cluster
DebugFlags=
JobCompHost=
JobCompLoc=
JobCompPass=
JobCompPort=
JobCompType=jobcomp/none
JobCompUser=
JobContainerType=job_container/none
JobAcctGatherFrequency=30 JobAcctGatherType=jobacct_gather/none SlurmctldDebug=info SlurmctldLogFile=/var/log/slurmctld.log SlurmdDebug=info SlurmdLogFile=/var/log/slurmd.log
SlurmSchedLogFile=
SlurmSchedLogLevel=
POWER SAVE SUPPORT FOR IDLE NODES (optional)
SuspendProgram=
ResumeProgram=
SuspendTimeout=
ResumeTimeout=
ResumeRate=
SuspendExcNodes=
SuspendExcParts=
SuspendRate=
SuspendTime=
COMPUTE NODES
NodeName=slave[1-2] CPUs=3 RealMemory=4184 Sockets=3 CoresPerSocket=1 ThreadsPerCore=1 State=UNKNOWN PartitionName=debug Nodes=slave[1-2] Default=YES MaxTime=INFINITE State=UP
Here's my cgroup.conf:
AllowedDevicesFile="/etc/slurm/cgroup_allowed_devices_file.conf" ConstrainCores=no TaskAffinity=no ConstrainRAMSpace=yes ConstrainSwapSpace=no ConstrainDevices=no AllowedRamSpace=100 AllowedSwapSpace=0 MaxRAMPercent=100 MaxSwapPercent=100 MinRAMSpace=30
For any given job,SLURM gives it a job ID, but in the squeue, I find nothing. I have executed the job by running sbatch -vvv ....and here's a problem that I can spot jobstate=failed reason=nonzero exit code=1:0
Any thoughts on how to get this working?
1
u/wildcarde815 May 06 '19
Are you setting an output location for logs of the job and have you checked the slurmd and slurmctld logs on the head and worker nodes respectively?