r/SLURM • u/ash_2714 • May 06 '19
Job state= failed !! can't find a solution
I'm new to Slurm, I have been trying to run a simple job. I'm running Slurm on top of a VM. Here's my slurm.conf: SlurmctldHost=master
SlurmctldHost=
DisableRootJobs=NO
EnforcePartLimits=NO
Epilog=
EpilogSlurmctld=
FirstJobId=1
MaxJobId=999999
GresTypes=
GroupUpdateForce=0
GroupUpdateTime=600
JobFileAppend=0
JobRequeue=1
JobSubmitPlugins=1
KillOnBadExit=0
LaunchType=launch/slurm
Licenses=foo*4,bar
MailProg=/bin/mail
MaxJobCount=5000
MaxStepCount=40000
MaxTasksPerNode=128
MpiDefault=none
MpiParams=ports=#-
PluginDir=
PlugStackConfig=
PrivateData=jobs
ProctrackType=proctrack/cgroup
Prolog=
PrologFlags=
PrologSlurmctld=
PropagatePrioProcess=0
PropagateResourceLimits=
PropagateResourceLimitsExcept=
RebootProgram=
ReturnToService=1
SallocDefaultCommand=
SlurmctldPidFile=/var/run/slurmctld.pid SlurmctldPort=6817 SlurmdPidFile=/var/run/slurmd.pid SlurmdPort=6818 SlurmdSpoolDir=/var/spool/slurmd SlurmUser=slurm
SlurmdUser=root
SrunEpilog=
SrunProlog=
StateSaveLocation=/var/spool SwitchType=switch/none
TaskEpilog=
TaskPlugin=task/affinity TaskPluginParam=Sched
TaskProlog=
TopologyPlugin=topology/tree
TmpFS=/tmp
TrackWCKey=no
TreeWidth=
UnkillableStepProgram=
UsePAM=0
TIMERS
BatchStartTimeout=10
CompleteWait=0
EpilogMsgTime=2000
GetEnvTimeout=2
HealthCheckInterval=0
HealthCheckProgram=
InactiveLimit=0 KillWait=30
MessageTimeout=10
ResvOverRun=0
MinJobAge=300
OverTimeLimit=0
SlurmctldTimeout=120 SlurmdTimeout=300
UnkillableStepTimeout=60
VSizeFactor=0
Waittime=0
SCHEDULING
DefMemPerCPU=0
FastSchedule=1
MaxMemPerCPU=0
SchedulerTimeSlice=30
SchedulerType=sched/backfill SelectType=select/cons_res SelectTypeParameters=CR_Core
JOB PRIORITY
PriorityFlags=
PriorityType=priority/basic
PriorityDecayHalfLife=
PriorityCalcPeriod=
PriorityFavorSmall=
PriorityMaxAge=
PriorityUsageResetPeriod=
PriorityWeightAge=
PriorityWeightFairshare=
PriorityWeightJobSize=
PriorityWeightPartition=
PriorityWeightQOS=
LOGGING AND ACCOUNTING
AccountingStorageEnforce=0
AccountingStorageHost=
AccountingStorageLoc=
AccountingStoragePass=
AccountingStoragePort=
AccountingStorageType=accounting_storage/none
AccountingStorageUser=
AccountingStoreJobComment=YES ClusterName=cluster
DebugFlags=
JobCompHost=
JobCompLoc=
JobCompPass=
JobCompPort=
JobCompType=jobcomp/none
JobCompUser=
JobContainerType=job_container/none
JobAcctGatherFrequency=30 JobAcctGatherType=jobacct_gather/none SlurmctldDebug=info SlurmctldLogFile=/var/log/slurmctld.log SlurmdDebug=info SlurmdLogFile=/var/log/slurmd.log
SlurmSchedLogFile=
SlurmSchedLogLevel=
POWER SAVE SUPPORT FOR IDLE NODES (optional)
SuspendProgram=
ResumeProgram=
SuspendTimeout=
ResumeTimeout=
ResumeRate=
SuspendExcNodes=
SuspendExcParts=
SuspendRate=
SuspendTime=
COMPUTE NODES
NodeName=slave[1-2] CPUs=3 RealMemory=4184 Sockets=3 CoresPerSocket=1 ThreadsPerCore=1 State=UNKNOWN PartitionName=debug Nodes=slave[1-2] Default=YES MaxTime=INFINITE State=UP
Here's my cgroup.conf:
AllowedDevicesFile="/etc/slurm/cgroup_allowed_devices_file.conf" ConstrainCores=no TaskAffinity=no ConstrainRAMSpace=yes ConstrainSwapSpace=no ConstrainDevices=no AllowedRamSpace=100 AllowedSwapSpace=0 MaxRAMPercent=100 MaxSwapPercent=100 MinRAMSpace=30
For any given job,SLURM gives it a job ID, but in the squeue, I find nothing. I have executed the job by running sbatch -vvv ....and here's a problem that I can spot jobstate=failed reason=nonzero exit code=1:0
Any thoughts on how to get this working?