#benchmark
6 článk(ov)
Claude Sonnet 5 prekvapuje: Lacný model predbieha vlajkovú loď
Anthropic predstavil Claude Sonnet 5, ktorý za nízku cenu prekonáva očakávania a dosahuje výsledky lepšie než drahší model. Tento vývoj môže zmeniť dynamiku trhu s AI modelmi.
OpenAI odhaľuje problémy v obľúbenom teste pre AI kóderov
OpenAI zistila, že približne 30 % úloh v teste SWE-Bench Pro, ktorý hodnotí programovacie schopnosti AI modelov, je chybných. Toto objavenie prichádza s rozhodnutím spoločnosti stiahnuť svoje predchádzajúce schválenie testu.
GeneBench-Pro: Nový štandard pre AI v genomike
GeneBench-Pro predstavuje revolúciu v testovaní umelej inteligencie pre potreby genomiky a biologického výskumu. S komplexnými reálnymi dátovými súbormi ponúka nový pohľad na vedecké aplikácie AI.
Nový benchmark HealthAgentBench modernizuje hodnotenie AI v zdravotníctve
HealthAgentBench je nová benchmarková súprava na hodnotenie AI agentov v zdravotníctve. Tento nástroj umožňuje testovanie komplexných schopností AI, ktoré sú zásadné pre ich aplikáciu v reálnom svete.
LifeSciBench: Nová benchmark pre hodnotenie AI v oblasti životných vied
LifeSciBench je nový nástroj pre hodnotenie schopností AI v riešení reálnych úloh v oblasti životných vied. Tento benchmark, vytvorený odborníkmi, má zásadný význam pre budúci vývoj umelej inteligencie v tejto oblasti.
NVIDIA Blackwell dominuje v benchmarku agentických AI systémov
NVIDIA Blackwell Ultra NVL72 vedie v prvom agentickom AI benchmarku AgentPerf, čo poskytuje jasný prehľad o výkone systémov pre vývojárov a podniky. Táto metrika prináša nové možnosti hodnotenia AI infraštruktúr.
