Remix.run Logo
cmrdporcupine 14 minutes ago

You're right. I'm getting ~33tok/sec w/ dflash on it, using my personal home-built-for-Spark inference engine (not vLLM or llama.cpp based)

That's pretty respectable.

Still working on optimizing and cleaning up before I push it.