
Vals AI
Independent LLM evaluation platform for enterprises. Builds private, domain-expert-constructed benchmarks across law, finance, healthcare, and coding, including Terminal-Bench and Vibe Code Bench, where datasets stay unpublished to prevent training-data contamination. Targets teams selecting models for high-stakes professional deployments where public leaderboards are unreliable.