What I'm missing in all of those one-shot tests:
How different are the results between multiple runs of the same setup?
I have done multiple runs on Qwen3.8 27B. Results are close enough across multiple runs qualitatively.
I have done multiple runs on Qwen3.8 27B. Results are close enough across multiple runs qualitatively.