What I'm missing in all of those one-shot tests:

How different are the results between multiple runs of the same setup?

I have done multiple runs on Qwen3.8 27B. Results are close enough across multiple runs qualitatively.