How do people really build infrastructure on top of #docker ?
I am in the midst of converting around 300 different batch jobs with osm data into docker containers and every day randomly docker containers fail to start up on creation.
After some time they are killed by timeout or the database does not start up and the container terminates itself because the database does not get reachable within 60 seconds. Etc etc etc
@flohoff K8s oder so'n Management-Layer drüber?
@wusel So - alle jobs jeweils mit --verbose starten - heute morgen wieder 2 gefailte:
compose.parallel.parallel_execute_iter: Failed: ServiceName(project='job167667', service='process', number=1)
ERROR: for job167667_process_1 UnixHTTPConnectionPool(host='localhost', port=None): Read timed out. (read timeout=60)
compose.parallel.parallel_execute_iter: Failed: <Service: process>
ERROR: for process UnixHTTPConnectionPool(host='localhost', port=None): Read timed out. (read timeout=60)
Natürlich nicht ohne ein
If you encounter this issue regularly because of slow network conditions, consider setting COMP
OSE_HTTP_TIMEOUT to a higher value (current value: 60).
Es ist localhost - die kiste hat langeweile - Also ist containerd eingeschlafen oder so ein zeugs
@wusel Ich wollte halt perspektivisch jobs über mehr als eine Maschine verteilen. Slurm kann das - nur ich brauche immer alle tools, teilweise binariers, teilweise temporäre postgres/postgis datenbanken.
Also baue ich mit das alles in docker container. Und jeder job hat nen git repo.
Slurm scheduled das auf einem node, der cloned sich die job geschreibung und docker compose wird mit dem docker-compose.yml file gestartet (Mit ein bisschen environment dabei wie secrets die gemapped werden etc)
Ich denke ich habe so statistisch 500-1000 Jobs am Tag - einige davon stumpf wiederkehrend, einige nur einmal. Einige laufen nur 5-10 Minuten. Andere laufen 12 Stunden. Einige job dependency bäume haben 2-5 Jobs - Andere haben 80 Jobs mit zig abhängigkeiten.
Und ich habe jeden tag gefailte jobs die beim restarten einfach gehen. Und die probleme sind nicht sauber startende docker container - nicht erreichbar, hängen geblieben etc etc etc. D.h. die fangen oft nichtmal an mein zeugs auszuführen. D.h. container image ist da, docker sagt "Alles top" - nur es läuft nicht. Und wenn ich jobs mit mehr als einem container habe startet der eine und der andere hängt.
Nervt gigantisch.