Skip to content
Notes by Axbom
Per Axbom LinkedIn

Det är nu 10 år sedan jag började publicera mina strukturerade tolkningar av WCAG (Web Content Accessibility Guidelines) på svenska.

På webbplatsen digitill.se får du en personlig genomgång av dessa riktlinjer för tillgänglighet som idag är starkt kopplade till Lag (2018:1937) om tillgänglighet till digital offentlig service (DOS-lagen). När det gäller EU-direktivet om tillgänglighetskrav för produkter och tjänster (European Accessibility Act) hänvisar man inte lika tydligt till WCAG men grundar sig i samma fyra principer för digital tillgänglighet: att produkterna ska vara möjliga att uppfatta ), möjliga att kontrollera (hanterbara), möjliga att förstå (begripliga) samt robusta.

Idag ägnade jag en stund åt att lyfta in de nya riktlinjerna i och med att WCAG 2.2 publicerades för ett par veckor sedan. Webbplatsen är alltså rykande aktuell igen. 😊 Men precis som jag skriver på webbplatsen så är riktlinjerna bara en liten del av tillgänglighet. Att lyssna på, involvera och anställa fler personer med funktionsnedsättningar i digital utveckling är centralt för att fler perspektiv ska få utrymme och bidra till inkluderande lösningar.

Digital tillgänglighet

🔗 Originally posted on LinkedIn

25 Oct 2023, 20:14
Share
LinkedIn Bluesky Email
Per Axbom Akkoma reply

@starfrost For me it's a design decision to make use of biased data and unsupervised training in your manufacturing process. Of course these companies are aware that vast amounts of their data is prejudiced.

The Google photos incident where a black person was tagged as a gorilla happened in 2015 and 8 years later they haven't fixed this, just blocked the ability to search for gorilla. These companies have had time to become aware of the bias problem.

There are definitely many useful applications for AI and it's possible to work around these issues and mitigate impact to some extent before harm happens. Many companies however choose not to. To work around these moral dilemmas I believe you need to be open and honest about their presence and how you are addressing them.

If you aren't actively looking for them as a user, prejudices will also make their way into everyday use of generative models.

🔗 Originally posted on Akkoma

25 Oct 2023, 18:42
Share
LinkedIn Bluesky Email
Per Axbom Akkoma reply

@karlemilnikka Gissar att det är Committee on Civil Liberties, Justice and Home Affairs om man ska följa sändningen?

https://multimedia.europarl.europa.eu/en/webstreaming/committee-on-civil-liberties-justice-and-home-affairs_20231025-1430-COMMITTEE-LIBE

🔗 Originally posted on Akkoma

25 Oct 2023, 14:21
Share
LinkedIn Bluesky Email
Per Axbom Akkoma reply

@pawsplay I'm not sure I understand your question. The poster suggests what a hammer would be if it was like AI, not what a hammer is.

So if a hammer was like AI, it would have been trained on someone else's data. It's a reflection of the ethical dilemmas of AI.

But you may be getting caught on the word "constructions" which in my mind refers to structures and buildings, not the composition of hammers.

Hence, a language model does not copy the composition of other language models, it is "trained" with copies of other people's content.

I hope this helps.

🔗 Originally posted on Akkoma

23 Oct 2023, 20:35
Share
LinkedIn Bluesky Email
Per Axbom Akkoma reply

@fasterandworse I'm thinking now how it will become more relevant in the future to have a policy in place with regards to what tools a company can force its employees to use.

I'm lucky to be self-employed, because there are many tools I would never want to touch but an employment may force me into.

🔗 Originally posted on Akkoma

23 Oct 2023, 12:29
Share
LinkedIn Bluesky Email
Per Axbom Akkoma reply

@fasterandworse Not at all! I'm 100% onboard with the lack of purpose being one of the most maddening aspects of this whole problem space.

You added a dimension where my point became even more interesting. They're not just releasing crap and fixing it, they're releasing crap without a purpose and fixing it. 😅

🔗 Originally posted on Akkoma

23 Oct 2023, 11:50
Share
LinkedIn Bluesky Email
Per Axbom Akkoma reply

@fasterandworse

I agree, but what I am seeing is that a "fixed" ChatGPT is responding to things like takedown requests from JK Rowling (by making it harder to get responses about the books), blocking explicit racism from responses and generally just addressing random garbage that pops up and makes it into the news cycle.

@tante

🔗 Originally posted on Akkoma

23 Oct 2023, 11:14
Share
LinkedIn Bluesky Email
Per Axbom Akkoma reply

@pivic

Yes, it's been in my backlog to add to the list, and yet it just feels like playing whack-a-mole most days... without any real impact. Will check out your blog!

@tante

🔗 Originally posted on Akkoma

23 Oct 2023, 11:11
Share
LinkedIn Bluesky Email
Per Axbom Akkoma reply

@tante

In my head at the time of writing was ChatGPT. :)

I've written about Zoom before, and for me it fits the bill to some extent.
https://axbom.com/avoid-zoom/

For me it's a component of the whole "ship first, fix later" or "release now, fix later" which the gaming industry appears to suffer from as well. I suppose this model naturally became normalized soon after it was possible to ship updates over the net. Many people appear to appreciate early access over fully functional.

🔗 Originally posted on Akkoma

23 Oct 2023, 10:10
Share
LinkedIn Bluesky Email
Per Axbom Akkoma

A strategy for ethically dubious products is to release something with a set of really poor features, and then improve it significantly within a short period of time.

1. The company will be applauded, and get good press, for quickly fixing something there was already a fix for at the time of release. (Nobody would have applauded the company for releasing something that worked well enough from the start.)

2. People will now more readily accept the updated version because it is "fixed". Chances are that the updated version, had it been released from the start, would have been criticised for being inferior. Now, it can be presented as the much improved version.

3. People will tend to forget about all the other ways the product is inferior, because the company has shown that they are making efforts to improve.

Releasing crap with a quick fix makes people lower their standards.

#DigitalEthics

🔗 Originally posted on Akkoma

23 Oct 2023, 09:49
Share
LinkedIn Bluesky Email
Per Axbom Akkoma reply

@efi I've had a handful of people react the way you do and reach out (since June), but my experience is that it's rare. I've had overwhelming positive feedback from people reasoning like I do. The title "If a hammer was like AI" usually gets people on the right track. If in doubt, there's always the web address :)

Mockery is not easy to pull off in a way that everyone gets the intent straight away, so I do understand it will sometimes fail in its messaging. I do appreciate you pointing out your interpretation and telling me.

🔗 Originally posted on Akkoma

23 Oct 2023, 07:14
Share
LinkedIn Bluesky Email
Per Axbom Akkoma

Here's what happens when machine learning needs vast amounts of data to build statistical models for responses. Historical, debunked data makes it into the models and is preferred by the model output. There is much more outdated, harmful information published than there is updated, correct information. Hence statistically more viable.

"In some cases, they appeared to reinforce long-held false beliefs about biological differences between Black and white people that experts have spent years trying to eradicate from medical institutions."

In this regard the tools don't take us to the future, but to the past.

No, you should never use language models for health advice. But there are many people arguing for exactly this to happen. I also believe these types of harmful biases make it into more machine learning applications than language models specifically.

In libraries across the world using the Dewey Decimal System (138 countries), LGBTI (lesbian, gay, bisexual, transgender and intersex) topics have throughout the 20th century variously been assigned to categories such as Abnormal Psychology, Perversion, Derangement, as a Social Problem and even as Medical Disorders.

Of course many of these historical biases are part of the source material used to make today's "intelligent" machines - bringing with them the risk of eradicating decades of progress.

It's important to understand how large language models work if you are going to use them. The way they have been released into the world means there are many people (including powerful decision-makers) with faulty expectations and a poor understanding of what they are using.

https://www.nature.com/articles/s41746-023-00939-z

#DigitalEthics #AIEthics

🔗 Originally posted on Akkoma

22 Oct 2023, 10:19
Share
LinkedIn Bluesky Email
Per Axbom LinkedIn

Here's what happens when machine learning needs vast amounts of data to build statistical models for responses. Historical, debunked data makes it into the models and is preferred by the model output. There is much more outdated, harmful information published than there is updated, correct information. Hence statistically more viable.

"In some cases, they appeared to reinforce long-held false beliefs about biological differences between Black and white people that experts have spent years trying to eradicate from medical institutions."

In this regard the tools don't take us to the future, but to the past.

No, you should never use language models for health advice. But there are many people arguing for exactly this to happen. I also believe these types of harmful biases make it into more machine learning applications than language models specifically.

In libraries across the world using the Dewey Decimal System (138 countries), LGBTI (lesbian, gay, bisexual, transgender and intersex) topics have throughout the 20th century variously been assigned to categories such as Abnormal Psychology, Perversion, Derangement, as a Social Problem and even as Medical Disorders.

Of course many of these historical biases are part of the source material used to make today's "intelligent" machines - bringing with them the risk of eradicating decades of progress.

It's important to understand how large language models work if you are going to use them. The way they have been released into the world means there are many people (including powerful decision-makers) with faulty expectations and a poor understanding of what they are using.

https://www.nature.com/articles/s41746-023-00939-z

🔗 Originally posted on LinkedIn

21 Oct 2023, 18:26
Share
LinkedIn Bluesky Email
Per Axbom Akkoma reply

@tsvenson @beantin I’m not sure politicians and lawyers I meet for the first time will want to put my web address on their computer… (or body 😁). But it’s great as a bookmark!

🔗 Originally posted on Akkoma

21 Oct 2023, 07:48
Share
LinkedIn Bluesky Email
Per Axbom Akkoma reply

@maddad Thank you.

🔗 Originally posted on Akkoma

20 Oct 2023, 19:42
Share
LinkedIn Bluesky Email
Per Axbom Akkoma reply

@CassandraZeroCovid Thank you.

🔗 Originally posted on Akkoma

20 Oct 2023, 19:42
Share
LinkedIn Bluesky Email
Per Axbom Akkoma

New business cards. Haven't had any in a fair few years, but been at events lately where it makes sense to have something to hand over.

Hand holding a business card with a simple line drawing of a person holding a sign. The sign reads

🔗 Originally posted on Akkoma

20 Oct 2023, 17:42
Share
LinkedIn Bluesky Email
Per Axbom Akkoma

I don’t believe I’ve ever had time to “jump on a quick call”.

🔗 Originally posted on Akkoma

20 Oct 2023, 10:34
Share
LinkedIn Bluesky Email
Per Axbom Akkoma

Benefits and risks of synthetic video and audio.

In this one-minute video I am speaking seven languages. In truth, I can speak two of those. None of the audio is actually me speaking, even if it sounds very much like my voice. And the video? Despite what it looks like, that’s not me moving my mouth. In some ways impressive and in other ways quite unsettling.

To make this happen I made a two-minute recording of myself talking in English about random stuff, and uploaded this as input to the generative tool provided by a service known as HeyGen. That video provided a voiceprint that can be used for more than 25 languages and counting. And honestly, the generated English voice really does sound like me.

With regards to the video, the scene where I appear to be standing is where I was actually standing when I recorded the original video. But the head, hand, eye and lip movements are all generated based on what I want my digital twin, or puppet, to say. I type text into a box and then the video with me, speaking in the selected language, comes out.

For purposes of firing up the mind to imagine what’s possible, this will likely suffice.
https://vimeo.com/875449365

In my latest blog post/newsletter I unpack the benefits and risks of this technology:
https://axbom.com/synthetic-video-benefits-risks/

#AIEthics #DigitalEthics #SyntheticVideo #DeepFake

🔗 Originally posted on Akkoma

20 Oct 2023, 08:32
Share
LinkedIn Bluesky Email
Per Axbom LinkedIn

I videon nedan, en minut lång, pratar jag sju språk. Egentligen kan jag bara tala två av dem. Inget av ljudet du hör är faktiskt jag som talar, även om det låter väldigt mycket som min röst. Och videon? Trots hur det ser ut är det inte jag som rör på munnen. På vissa sätt imponerande och på andra sätt tämligen obehagligt.

🔗 Compilation: Synthetic video and audio

För att uppnå det här resultatet gjorde jag en två minuters-inspelning av mig själv när jag pratade på engelska om vardagliga saker. Jag laddade upp denna som input till det generativa verktyget som tillhandahålls av en tjänst som kallas HeyGen. Den videon gav ett röstavtryck som kan användas för ett växande antal språk, idag mer än 25. Och ärligt talat, den genererade engelska rösten låter verkligen som jag.

När det gäller videon, så är scenen där jag ser ut att stå faktiskt där jag stod när jag spelade in originalvideon. Men huvud-, hand-, ögon- och läpprörelser genereras alla baserat på vad jag vill att min digitala tvilling, eller docka, ska säga. Jag skriver text i en ruta och tillbaka får jag en video med mig, talandes språket som texten skrevs på.

Observera också att tjänsten inte har några problem med rörelse i bakgrunden, vilket är något jag ville testa.

Din personliga docka kommer att säga vad som helst

För att vara tydlig: jag använder budgetversionen av den här tjänsten. Låt oss säga att jag vill ha en helkroppsversion av mig själv med anpassningsbara bakgrunder. Jag skulle åstadkomma det genom att spela in några minuter av mig själv när jag pratar i en green screen-studio. Lite dyrare, men inte alls krångligt

I syfte att väcka dina fantasi till att föreställa sig vad som är möjligt är detta förmodligen tillräckligt.

Jag kan se fördelar här för många typer av roller. Utbildare, chefer och presentatörer som behöver göra tillkännagivanden eller korta handledningar. En digital docka kan också helt enkelt läsa upp mötesprotokoll eller rapporter för personer som helst inte vill – eller inte kan – läsa.

Fördelar

Vissa fördelar är lätta att ta till sig:

  • Det finns inget behov av omtagningar eftersom det inte förekommer stamning, stakande eller snubblande över ord. Tekniskt strul lyser också med sin frånvaro och tidsbesparingarna blir därför kolossala.
  • Om jag vill ändra ett ord i det jag säger i videon betyder det att jag bokstavligen bara ändrar ordet i manuset. Ljudet av min virtuella röst förändras inte över dagen som det gör i verkligheten, där jag ofta måste spela in långa segment igen för att inte dra uppmärksamhet till skillnader i röstläge.
  • Jag behöver inte sätta upp en kamera, fixa belysningen eller ens klä på mig. Den visuella scenen är redan etablerad. Kom ihåg att du kan skapa ett konto för att ha ett urval av scener för olika tillfällen. Du behöver bara en två minuters källvideo för varje scen.
  • Jag kan skapa versioner av samma video på flera språk, inklusive de jag inte kan. Ja, denna nytta kan förstås leda till en rad problem.

Risker

Vilka är då riskerna?

  • Om du automatiskt översätter till språk du inte behärskar kan ditt budskap bli grammatiskt felaktigt, förvirrande eller till och med kränkande på sätt som du inte hade tänkt dig. Att ha någon språkkunnig som ansvarar för kvalitetssäkring är fortfarande ett måste.
  • Okonventionella uttal kommer sannolikt att hända då och då också, och hände mig när jag skapade en svensk röst. Jag behärskar förstås språket och blev inte jätteimponerad av hur vissa ord uttalades. Eller vilka ord som valdes vid automatisk översättning. Du måste anta att detta sker för alla språk.
  • Människor kan känna sig lurade och tappa förtroendet om du inte är transparent med vad som verkligen pågår. Tydlighet kring teknikanvändning kommer att ha betydelse. Och även när folk är medvetna kan de känna att du tar ohederliga genvägar och inte lägger ner förväntat arbete. Ditt specifika sammanhang kommer att ha betydelse.
  • Överanvändning. Ja, när något är enkelt nog är det troligt att det kommer att sättas i bruk i många situationer där det faktiskt inte är så användbart eller relevant. Detta påverkar också den långsiktiga kvaliteten, och tilliten hos mottagarna.
  • När du använder en tredjepartstjänst se till att du förstår hur – och under vilka omständigheter – materialet du använder som input (dina videor och ditt textinnehåll/manus) kan användas av leverantören för att finjustera tjänsten. Du vill försäkra dig om att inget känsligt innehåll hamnar på oönskade platser och att du inte avsäger dig rättigheter för andra att använda din avbild.
  • Vem får styra din digitala tvilling? Den smidiga och friktionsfria upplevelsen av att ha en virtuell docka som du enkelt kan delegera kontroll över till andra kan naturligtvis slå tillbaka. Du kanske plötsligt tycker att din avbild säger saker som du inte riktigt har gått med på. Och om tillit blir ett problem, hur kommer förtroendet för den här typen av virtuella presentationer påverkas över tid?

Utöver dessa risker så kommer syntetisk video naturligtvis också att fungera som verktyg för missbruk och övergrepp. Jag nämnde kort att kontrollen över någons digitala tvilling innebär att du kan ge sken av att de säger vad som helst – och lura ett stort antal människor. Detta kan innefatta allt från smaklösa skämt till att få någon att hetsa till våld eller häva ur sig rasistiska kommentarer.

När det gäller övergrepp vill jag öka medvetenheten om det faktum att många unga kvinnor utsätts för att bli virtuella skådespelare i pornografiska filmer mot sin vilja, med mycket liten makt att invända eller ställa förövare inför rätta. Och även om lagar och tillsynsåtgärder förbättras, är många liv redan förstörda så snart det kränkande innehållet publiceras. Om du någon gång stöter på dylikt innehåll, rapportera det alltid till polisen omedelbart.

Tänk på hur ... men också varför och när och vem ... och varför inte

Fler och fler individer och organisationer kommer sannolikt att använda generativ programvara för att producera syntetisk video. Om du tror att det finns fördelar för dig och din verksamhet bör du sätta igång att lära dig. Men du måste också överväga och hantera användningsfall där transparens, pålitlighet och risker spelar in. Ett felsteg kan radera alla upplevda fördelar på några sekunder, om tilliten går förlorad.

Kanske viktigast av allt är nog att du själv bara som varandes en människa på den här planeten förmodligen måste vara medveten om just detta: det är enkelt och billigt nu för vem som helst att använda någon annans ansikte och få dem att säga vad som helst. På vilket språk som helst.


Listan över fördelar och risker i den här artikeln är inte uttömmande. 🧰

Det finns metoder och verktyg för att avslöja etiska dilemman och hantera dem. I Elementen inom AI-etik hittar du en kartläggning av potentiella skador som kan hjälpa dig att styra ditt arbete. Element som inte nämns i detta inlägg är till exempel miljöpåverkan och exploatering av arbetare. Säg till om jag kan hjälpa till som rådgivare.

P.S. Jag lutar mer och mer åt att kalla det dockvideo, eller marionettvideo, snarare än syntetisk video. Vad tycker du?


Alla filmer 🎬

Här finns fullängdsversionerna av filmerna med mig som säger samma meddelande på sju olika språk. Jag har också inkluderat en version av mig som talar svenska med min egen röst, för att kunna jämföra. Videon för det klippet genereras alltså baserat på min riktiga röst, och det kan vara bra att veta att det också är ett alternativ att använda ljud som ingång för videoskapandet.


Hitta tillbaka? 🕵️

Originalet till dessa nyhetsbrev publiceras alltid på min egen blogg för att inte vara beroende av LinkedIn som plattform för synlighet, arkivering och fortlevnad. Där hittar du också tips på vidare läsning, och en hel del av mina produktioner i andra format.

  • Original: Fördelar och risker med syntetisk video och röst
  • Original på engelska: Benefits and risks of synthetic video and audio

🔗 Originally posted on LinkedIn

20 Oct 2023, 07:23
Share
LinkedIn Bluesky Email
← Newer Older →
  • Notes by Axbom
  • RSS

© 2026 Notes by Axbom